{"as_of":"2026-08-17T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a76ab57544153a38846558be36b90a5c26dc85e5d1467d494ec8823d0838b93","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:36:42.436933Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06901/citation-record","integrity":"/paper/2505.06901/integrity","json":"/paper/2505.06901/citation-record.json","paper":"/paper/2505.06901"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.729114Z","title":"2023.AMD Instinct™MI300X Accelerator: Technical Overview","venue":null,"work_id":"c1c14274-b841-410a-b7c9-d25d8265a485","year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.142378Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:c3ae14714be9b33675e47e004f8d0c2399d2339d65ebc32879e4728f06032e06","observation_id":"9ba44858-284c-495e-850b-baf81a56841b","resolution":{"observed_at":"2026-08-15T22:36:43.733598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.716189Z","title":null,"venue":null,"work_id":"353da5bd-ba37-4ac2-a6a3-6e4879102589","year":2004},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.147134Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:84f62f6ed453211fa72d3782f59f8c0cb67843d7b5ac5bbaef23c37a0ab5403c","observation_id":"ea690f7a-7b70-4fcf-a2ec-9f76244832d3","resolution":{"observed_at":"2026-08-15T22:36:43.720182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-16T14:04:57.666315Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-15T22:36:42.151190Z","title":"Croci, Bo Li, Pashmina Cameron, Martin Jaggi, Dan Alistarh, Torsten Hoefler, and James Hensman","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.151190Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:3c6da3cf8586c984dd6df452c3905a5fa8f89cae07e8bc9d933967a87f2d1793","observation_id":"0eed6b22-e74f-4328-8951-48535e6c1226","resolution":{"observed_at":"2026-08-15T22:36:42.151190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.155706Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.155706Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:753758b5fb5d9d4702fcf58e985f138297114eb907f523f3289a4b518e166a64","observation_id":"b7128f30-57b7-4429-8fac-d2d768147546","resolution":{"observed_at":"2026-08-15T22:36:42.155706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.164075Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.164075Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:1d9beacbf8c0bece4d9b97917dff22eda4b4f475ac8985d7cf3b7a6512c9ee49","observation_id":"1b6e17f6-115b-48c5-aebf-a2a510d2fd6e","resolution":{"observed_at":"2026-08-15T22:36:42.164075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.688486Z","title":null,"venue":null,"work_id":"c0252ce8-2761-4654-8b72-58dea6aaf376","year":2022},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.168378Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:6a0dcddbdd18dec3be9dedd0f16fdb5ee9f41b5e26fdf1b1438b98e241dbcc1c","observation_id":"ae70cfc8-7e2f-4f06-944a-2f544117442e","resolution":{"observed_at":"2026-08-15T22:36:43.692728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.173455Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.173455Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:fb3f3c1149cbc8fab77de5143f7bbb73ab8857d0ffd77f48f201794480fad812","observation_id":"fbbf2c78-8a1b-4e24-90b2-eed0231aac3c","resolution":{"observed_at":"2026-08-15T22:36:42.173455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.02596","last_updated":"2019-04-15T23:28:48Z","snapshot_observed_at":"2026-08-14T17:06:19.617817Z","submitted_at":"2019-03-06T19:55:19Z","title":"Buddy Compression: Enabling Larger Memory for Deep Learning and HPC Workloads on GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.02596","snapshot_observed_at":"2026-08-15T22:36:42.177685Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.177685Z"},"links":{"cited_paper":"/paper/1903.02596","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:60cebdbbcbab32d4614f35abeeca9280bb60ffb2b065e62d9759f3f5141502a8","observation_id":"7c1d2d16-ceb5-4ce0-8c86-c496ac3df8fe","resolution":{"observed_at":"2026-08-15T22:36:42.177685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T22:36:42.182102Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.182102Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:932c929ff6580d961216e58e7d7b86a0dfa38e508569ef3897b1713fbf927ed9","observation_id":"01bedb1e-4807-42c1-bb62-9aad6cee91e3","resolution":{"observed_at":"2026-08-15T22:36:42.182102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-15T22:36:42.186179Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.186179Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:301c3e8db419a7594f52fccdf94f7c5dbea5c2a6eff6273a710d8344b1e95452","observation_id":"bfbe14cd-d1b8-4b1e-8da5-b89d2741f42b","resolution":{"observed_at":"2026-08-15T22:36:42.186179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-15T22:36:42.194595Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.194595Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:b6703b63db822875940982227f756b34a98e36b55310b5aad2ceca6d71889710","observation_id":"2d37c38d-2f87-42f5-8d8a-fc66dd6bc80d","resolution":{"observed_at":"2026-08-15T22:36:42.194595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-15T22:36:42.198654Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.198654Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:d0ea8ba27bb3a6855fa60d4ba30f9e9f4d5ff0ceea3222f15f3202efad6b8559","observation_id":"f2bf3ee0-e093-4a24-8b77-744ac2ad06e7","resolution":{"observed_at":"2026-08-15T22:36:42.198654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.202764Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.202764Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:118e33e5197f8c75815783dd3a592597e03441ad156f8f18e6e48a28b91788d1","observation_id":"f2bf3a08-1563-46c5-9e40-93449848118f","resolution":{"observed_at":"2026-08-15T22:36:42.202764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-15T22:36:42.206873Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.206873Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:9dd6866882d41ec57b99a243c75e129f7a5c9ffbdbecd17ac61f271e0d0f5ad6","observation_id":"18fb1da2-22d7-4652-ac62-c5f9d2f85d66","resolution":{"observed_at":"2026-08-15T22:36:42.206873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.674299Z","title":null,"venue":null,"work_id":"1448a508-2bfb-4356-b79d-4094662a2ed3","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.211016Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:e66c28e9f049e21d668cda6a71c7f4a67ee6c086247b3d52449509feeb48451b","observation_id":"93d97360-809d-4fc6-adf2-2ffe738e7b34","resolution":{"observed_at":"2026-08-15T22:36:43.678971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.214966Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.214966Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:8a260cdcb0fdf509646c06ed36d7b0cd7d55b7d0825ce4e5c88ee2c009ab29b9","observation_id":"dd0b94f4-1226-47bb-98c5-b4e2392e10c8","resolution":{"observed_at":"2026-08-15T22:36:42.214966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.649278Z","title":null,"venue":null,"work_id":"7df2cd04-81e9-46b5-a58e-dbaffe572999","year":null},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.218980Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:c7e5ed0c08036c279632a9404426d891e7ad8f37e7f243b29a660e05b9e0d1a7","observation_id":"d70f915d-8b2d-4619-b5af-620a56bd5df9","resolution":{"observed_at":"2026-08-15T22:36:43.653270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.227106Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.227106Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:b39c9cc414c1ab4b21ce5b70863991a99880809e056081d6de4c06bfb96e251b","observation_id":"186bc34c-753a-4e13-91ff-94fc7b7db737","resolution":{"observed_at":"2026-08-15T22:36:42.227106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.630898Z","title":null,"venue":null,"work_id":"7c3e63fd-f4bd-430c-9b91-d0ab5ef27efa","year":2022},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.231005Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:54e7e8fd75ff224bb40e80a839fdfea6afa23714e06350934859787dbdf34513","observation_id":"1ae65579-1ac3-47c5-b7ac-dedb2e444839","resolution":{"observed_at":"2026-08-15T22:36:43.634748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.234680Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.234680Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:94bc1dad5bfbc6c4132dc3d20a6a79f0819d8a708e06d755ab7736455ccba543","observation_id":"b67f1e06-250e-4912-bb6d-192b6ccb2219","resolution":{"observed_at":"2026-08-15T22:36:42.234680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.238452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.238452Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:04aedfe76b2364b05e26b2fba195ab284f3117c6fed76c661199e33ef315aa7b","observation_id":"24195b5b-5e41-4a25-8dd4-f8e4a5affd25","resolution":{"observed_at":"2026-08-15T22:36:42.238452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.242177Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.242177Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:239a00190c56d3c6b52c390f1e024c28d5bdfb782eb7897af4936b7233c2460f","observation_id":"d770ce9c-ac0e-46d1-b221-fd2f52a04d89","resolution":{"observed_at":"2026-08-15T22:36:42.242177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.604272Z","title":null,"venue":null,"work_id":"63eb99ed-45ec-4743-b469-072ceb083613","year":2016},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.246005Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:cda4d9482c3e81911dad7e10c24dba0a625e6b500a7cddef08d73044dc7eec48","observation_id":"c8fb3e41-15a1-4341-885b-58b97e80ee96","resolution":{"observed_at":"2026-08-15T22:36:43.608129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-15T22:36:42.249513Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.249513Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:4e397089c88530a629a5df534c0bcc229dd7f56183d4bd43e90d5d64d15bfb11","observation_id":"01eee136-35ac-4030-ae3a-0f9c4bdf5391","resolution":{"observed_at":"2026-08-15T22:36:42.249513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.591831Z","title":null,"venue":null,"work_id":"643524bf-cac8-491e-b618-1ddec08a19bf","year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.253339Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:069663a6525acc9c9adcc00ddebc5181ea99d05089b790e38d35532e11bdf951","observation_id":"6dea8987-df02-4fa3-b4a5-5dd2d129cbd7","resolution":{"observed_at":"2026-08-15T22:36:43.595849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-17T08:27:45.946180Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T22:36:42.257055Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.257055Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:e9a39c229b99f965d66a94affc9bc49f1b659aede71acc984231e45ea95c8b78","observation_id":"1bc47a00-7d92-4512-be9c-e6aea921184b","resolution":{"observed_at":"2026-08-15T22:36:42.257055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.261185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.261185Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:a336663fa396bf967d2cdff11c5bb51936d6160d13450af5170aab705857a8bf","observation_id":"d0af8b2f-7d8f-4b4b-b2a7-10822f65be99","resolution":{"observed_at":"2026-08-15T22:36:42.261185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-08-15T22:36:42.264954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.264954Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:d7a14244182d2bbc92bf976e2afc698b21530a09237356a6a898d2b34986ad44","observation_id":"b10a2068-e407-4559-a329-69e4a0fc8533","resolution":{"observed_at":"2026-08-15T22:36:42.264954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.572473Z","title":null,"venue":null,"work_id":"60d05e5b-362b-48c5-962d-b80ead7820da","year":1952},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.269030Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:45e1d185c2c7b4b9ffac41fff75a8d2388383c7e0d57813f619722b5283fe31e","observation_id":"49833275-173d-4355-bd48-fe13ad47a197","resolution":{"observed_at":"2026-08-15T22:36:43.576643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.559281Z","title":null,"venue":null,"work_id":"bc658bf4-95d4-48ae-b29d-21fcbc7aedfb","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.272739Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:f7e88dd9e849c327e302812eb4e1e33f8fd05d484f7acd3586ad50ebdaad1b1a","observation_id":"0f615f21-e179-4fc4-a69c-edada259c8f1","resolution":{"observed_at":"2026-08-15T22:36:43.563348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05877","last_updated":"2017-12-15T23:56:52Z","snapshot_observed_at":"2026-08-14T20:03:06.929797Z","submitted_at":"2017-12-15T23:56:52Z","title":"Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05877","snapshot_observed_at":"2026-08-15T22:36:42.276351Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.276351Z"},"links":{"cited_paper":"/paper/1712.05877","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:0851366fac08dc86c8cf417f7916040e5cb96e40c5efcdf0399b32f3001f28ab","observation_id":"d5f07562-c26f-4da9-ac35-d13c1ceda427","resolution":{"observed_at":"2026-08-15T22:36:42.276351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.280103Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.280103Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:8a55d5ae7f8e6a6a6db8943ba9ccd56111a3d7777f29b1edb45594bbf776873a","observation_id":"5c6b69ca-48d9-4583-b5e2-4408869278bd","resolution":{"observed_at":"2026-08-15T22:36:42.280103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T22:36:42.283492Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.283492Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:6a9ea39f6ac0849204b3ef84f94501af739f6e29b35ba75b75b5ad3ad87b047c","observation_id":"eb5746a8-9e82-4021-9f07-d2c0d63d8665","resolution":{"observed_at":"2026-08-15T22:36:42.283492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:36:42.287406Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.287406Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:96ad9b6bc678a0b85d5e128fb6ccc18e4366c9151f493a8b918f28dd5f3c4e81","observation_id":"4707d447-edad-4fee-b2a6-86716e015dc7","resolution":{"observed_at":"2026-08-15T22:36:42.287406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.291153Z","title":"Aamodt, and Timothy G","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.291153Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:0736c859f2e95e0bd4bcea63c9d337286e170bedbf2ede6bf2cd890914ebc195","observation_id":"4363da4d-df96-41ee-a730-3d5fdbc79550","resolution":{"observed_at":"2026-08-15T22:36:42.291153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-16T15:24:21.726803Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-15T22:36:42.294573Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.294573Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:dc3efbf8eb263bc2fb0e5a88424ccbe72e85a298da74bd1470a20ee7619d3bf3","observation_id":"bfaae37a-2dbb-4bac-9dff-6cb3a04119de","resolution":{"observed_at":"2026-08-15T22:36:42.294573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10017","last_updated":"2022-11-18T03:43:52Z","snapshot_observed_at":"2026-08-17T04:14:59.528664Z","submitted_at":"2022-11-18T03:43:52Z","title":"Who Says Elephants Can't Run: Bringing Large Scale MoE Models into Cloud Scale Production","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10017","snapshot_observed_at":"2026-08-15T22:36:42.298592Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.298592Z"},"links":{"cited_paper":"/paper/2211.10017","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:face93e1165cb2ad661a8ff12eba11bd5e9b107dea92ab603601566649a7d987","observation_id":"2d0e2cc0-40ab-4dca-a2b6-45e6a1e09118","resolution":{"observed_at":"2026-08-15T22:36:42.298592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.302129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.302129Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:4e2d042715ce69c6f9fe5f85fab38ceea10fa66a8b08671d54ea4ee8a8e6dd8b","observation_id":"85c98218-db0e-44fb-84dc-48c290e92afc","resolution":{"observed_at":"2026-08-15T22:36:42.302129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.08933","last_updated":"2019-01-26T23:24:48Z","snapshot_observed_at":"2026-08-14T17:57:16.695078Z","submitted_at":"2018-11-18T07:52:34Z","title":"Analyzing Machine Learning Workloads Using a Detailed GPU Simulator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.08933","snapshot_observed_at":"2026-08-15T22:36:42.305885Z","title":"Sinclair, Timothy G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.305885Z"},"links":{"cited_paper":"/paper/1811.08933","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:3ef6152544a2d9008975babc3da8d71125fc7d379a6b732c3ca8b3be2447cede","observation_id":"2407bd37-3565-4402-8567-0cb1374c2dc2","resolution":{"observed_at":"2026-08-15T22:36:42.305885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04466","last_updated":"2025-06-13T12:20:54Z","snapshot_observed_at":"2026-08-16T13:12:11.320698Z","submitted_at":"2024-10-06T12:42:04Z","title":"Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04466","snapshot_observed_at":"2026-08-15T22:36:42.309597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.309597Z"},"links":{"cited_paper":"/paper/2410.04466","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:da6941fb515fe0802786431329aaa662cd178a72b743e4df16f074415f6b5cb1","observation_id":"1e02f5d3-6361-4b28-a192-c7398f968843","resolution":{"observed_at":"2026-08-15T22:36:42.309597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.546517Z","title":null,"venue":null,"work_id":"78896102-cd5c-47b7-9a5d-45c2dae3b54a","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.313451Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:2f0b99af3fd72a51a89b83451808cbd037916cdf2881f3d73b7cfa209f6ce9cc","observation_id":"d465a060-e80a-4919-bbf4-81f4f305f7e1","resolution":{"observed_at":"2026-08-15T22:36:43.550666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-16T13:54:34.341970Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-15T22:36:42.317271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.317271Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:186eb7aa3703cb4eb12b7940f3106e96f015e00600a69f92b5878a8324200fc0","observation_id":"8cb22b35-3b3d-4c3e-a0e3-0b8e0b465e69","resolution":{"observed_at":"2026-08-15T22:36:42.317271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.534535Z","title":null,"venue":null,"work_id":"6a9cecfd-fcc8-4fbd-bed6-558a41e154b2","year":1967},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.321134Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:f09ec56ef8ae17b9970098c0907bc8f00eee5ea495f51d7c73e8fa8690836a45","observation_id":"1e983ade-44c3-4dad-ab47-200baeeeffe8","resolution":{"observed_at":"2026-08-15T22:36:43.538976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-15T22:36:42.324901Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.324901Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:905d809cf4d132feeecec40a8fa46f73bc72f9e5cf155eed3ab6d71294d42c98","observation_id":"749c5ed9-e825-4c75-bbe0-2a5a436704aa","resolution":{"observed_at":"2026-08-15T22:36:42.324901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.328921Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.328921Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:49c97ae27cfb4c587d289c22d6ddbc8a2ebd10fb932ef92fd834055912dc2a6d","observation_id":"78ecc4e0-8103-4f4f-8ca6-e92f957a1b54","resolution":{"observed_at":"2026-08-15T22:36:42.328921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.512724Z","title":null,"venue":null,"work_id":"ee96d3ab-dd32-4506-92df-9d4810722fd1","year":2020},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.332424Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:89ae7d041532616b10c1e0a1cd63bd64045347f280191a9df9cf7d188d999de2","observation_id":"561cd770-6ed1-4ea5-ad76-3f3c5a6997c6","resolution":{"observed_at":"2026-08-15T22:36:43.517798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.501739Z","title":null,"venue":null,"work_id":"54e9720b-3b06-49d5-8e8f-0fa74dd70368","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.336111Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:e7a5793cdf241767b47ff521c9227f02bf873797ba3c64b558ceff14d546b74e","observation_id":"1959a8d6-55bb-4f2f-9ad0-b9f788f61cf5","resolution":{"observed_at":"2026-08-15T22:36:43.505307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.490599Z","title":null,"venue":null,"work_id":"0021946c-0fa0-489a-9a16-fecd6fd81b3e","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.339348Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:ec4ea13bc6f28cd5c1d39fd00c2174103d75b042034f99338cca738edd057b7c","observation_id":"09ba496e-b8e2-4b7f-8ffb-ce4a7b2b6052","resolution":{"observed_at":"2026-08-15T22:36:43.494255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.478926Z","title":null,"venue":null,"work_id":"48070f0e-774b-4023-b582-b99a12d1caa8","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.342687Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:d4920ef6faea7a5d84076b2ab0f4cd848e78f20ea289a60b5b044096bc7d1b5c","observation_id":"2ded34c2-9efb-4be0-8fb9-53f8733a70f5","resolution":{"observed_at":"2026-08-15T22:36:43.483004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.467093Z","title":null,"venue":null,"work_id":"ec5257ce-4fe3-45e1-99cc-768a8f260aae","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.346148Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:1b0c1e5e6cd77a10d36d0d05f3ec1457a19d8540df57f1ce075440330168563e","observation_id":"7797d6a1-0c47-4245-a646-81215e2102a0","resolution":{"observed_at":"2026-08-15T22:36:43.470944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.455565Z","title":null,"venue":null,"work_id":"4715a97a-a57d-4904-8afe-6063ba84abc4","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.349595Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:f871ec4443f1725bf648af6fcbdfbd82e3603bae59011464030fda42fa54de4b","observation_id":"0a8891b9-3be5-449e-93c4-c10578a64d1a","resolution":{"observed_at":"2026-08-15T22:36:43.459409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.443061Z","title":null,"venue":null,"work_id":"7d2507ba-4ecd-4837-baff-04d0cd9c62f1","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.353237Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:6c5dce8b3ab7ebe7e46b6031dcc3a6cf1c5b86d13342036179fc8444cf6022fe","observation_id":"0c89043f-eb67-43f1-883e-856c0c9ffe4c","resolution":{"observed_at":"2026-08-15T22:36:43.447328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.431261Z","title":null,"venue":null,"work_id":"117bd40f-162f-4ba7-a296-7553465d595a","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.357141Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:9d164e5e86d201d98cac45cc53dc006ee02642f60b179088ba669653e0a3b109","observation_id":"a3f0707f-5710-4a6e-8d8d-ab54cc6ae2ac","resolution":{"observed_at":"2026-08-15T22:36:43.435447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:36:42.360730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.360730Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:02706b4a8a5054f7591a92d4c78cf60a31d45d6a79698ac826ca6d0c097b6f3b","observation_id":"f639c17c-6756-4a77-9ea4-de74e1098382","resolution":{"observed_at":"2026-08-15T22:36:42.360730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-16T14:38:46.729665Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-15T22:36:42.365015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.365015Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:7c9dd7953f032fa78016e6e93ec6fb9d46d47fe8580069f4184b6f8fc1d5cffa","observation_id":"5fb55292-f727-4954-aaa7-ff7ba3cff7bd","resolution":{"observed_at":"2026-08-15T22:36:42.365015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.369077Z","title":"Gibbons, Michael A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.369077Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:72eaa2e2c223c0bc5b07c2d4867635cc5f07214e8c20a000b65cfd84c1eb0dfb","observation_id":"c8f90535-7c58-416b-9013-06d8fde66837","resolution":{"observed_at":"2026-08-15T22:36:42.369077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.419687Z","title":null,"venue":null,"work_id":"e98ef5a0-6400-4d2c-b0d4-411dbc54fa7c","year":2022},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.373488Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:fe8afd70dd8529020379458a23c5b7615344084bce58328bfaf72aa648a3dae5","observation_id":"78c62cb9-34d8-44db-af9c-746c0a9193d9","resolution":{"observed_at":"2026-08-15T22:36:43.423588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.378095Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.378095Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:fbfad628e434286c8c7231c603ee858d1b30888b7c88459897b6854a87fa8e19","observation_id":"dd563f12-7bdd-4e50-9187-edd04ebc34eb","resolution":{"observed_at":"2026-08-15T22:36:42.378095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-15T22:36:42.382309Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.382309Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:0494a347717f4efe84116a1ce2ff84fa298968139dcbe9ddb5fe0f8d9828e82e","observation_id":"ff5ed6d3-412c-4f4c-993f-4ffb51d5628c","resolution":{"observed_at":"2026-08-15T22:36:42.382309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.400267Z","title":"2017.High perfor- mance computing: modern systems and practices","venue":null,"work_id":"c9f43054-2aba-4c9c-b4e6-a4dfb47ccdb9","year":2017},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.386187Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:f71cf8b17b0899a2966e9cdc57786b8b6b8917decc6ffb16c33255a36cb4c1b0","observation_id":"ede45b41-043e-4c1d-a40a-bc47571200ff","resolution":{"observed_at":"2026-08-15T22:36:43.404917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T22:36:42.389811Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.389811Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:aa0a9732e8de160ea6d68ef2c83f1699c4fb266d1ea62d35b97e05ccbd9872b7","observation_id":"60f7d2ff-7b0e-47c1-8f07-cec00f912d6d","resolution":{"observed_at":"2026-08-15T22:36:42.389811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T22:36:42.393553Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.393553Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:2ec904c4be33c86a496acfdb981754b8fe6449c36195589490f86912f955c88f","observation_id":"01b85d50-cf37-4668-9877-8166b9afb727","resolution":{"observed_at":"2026-08-15T22:36:42.393553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-17T01:19:18.409791Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-15T22:36:42.397502Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.397502Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:da0e3a7c339390796001e011a86a37a66cf2d778d27356a4689eaf1f3cb61a04","observation_id":"f28783a7-fb44-4199-9980-abdf5031f734","resolution":{"observed_at":"2026-08-15T22:36:42.397502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.401214Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.401214Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:0fd3802a95550c75b8b44dad6504d7dfb8e5450d6c74a4fbdcbb264f05acfb5e","observation_id":"0f32195b-1722-4334-afd9-6948acc521df","resolution":{"observed_at":"2026-08-15T22:36:42.401214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.404990Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.404990Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:ae8413bcf0b6ca16937709115f0933d49d86a1c426c5f3f60f1adf0513943099","observation_id":"6c557f79-84ef-45c9-99e8-06f5dd0dcf0c","resolution":{"observed_at":"2026-08-15T22:36:42.404990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.408693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.408693Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:a8d298285c9646a4ba87d5448f8dc955f14838ce85f26f1c7b5aeaeb89ceaa70","observation_id":"fa450781-395d-47fe-ae02-8d469f824514","resolution":{"observed_at":"2026-08-15T22:36:42.408693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.412472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.412472Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:18eeaf2a1da7c9f987b35df6f3f11a3f2d454a30179a8a4ae2443375cc264d21","observation_id":"1d1036fc-d1e5-4d1e-9812-3c6eb9964d61","resolution":{"observed_at":"2026-08-15T22:36:42.412472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-15T22:36:42.420509Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.420509Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:39baffe7d81d12ea455665c2b8ffa0190c403533f80cebe704eff5133d842c49","observation_id":"9fb2d416-6127-4d2b-8aee-b54a14438a3a","resolution":{"observed_at":"2026-08-15T22:36:42.420509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-16T14:15:25.301514Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-15T22:36:42.424522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.424522Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:f71196ca9133ce2d88bb837aa8f23c341f69b20fc9625c024ef234577c9cbad9","observation_id":"63c20992-d18b-46b9-b860-4613b516d4f0","resolution":{"observed_at":"2026-08-15T22:36:42.424522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-15T22:36:42.429090Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.429090Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:9a975617567daa707cb964866f0034186409eabb336dad1ed5d86b3459620a27","observation_id":"212a593c-b1d5-4228-8c15-29aa3e597ce1","resolution":{"observed_at":"2026-08-15T22:36:42.429090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:43.363603Z","title":null,"venue":null,"work_id":"2dfc7cb2-98d5-4953-8d73-3a96d36bbc63","year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.433152Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:74d179de69f5455b1e9cc98cdc626dfbb5260dff1ad183f8b5478194b46a24ab","observation_id":"58e2e9f4-a798-4e41-9146-566e93cbd31b","resolution":{"observed_at":"2026-08-15T22:36:43.369704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17450","last_updated":"2024-11-03T02:21:39Z","snapshot_observed_at":"2026-08-16T14:23:04.753606Z","submitted_at":"2024-01-30T21:25:36Z","title":"Qplacer: Frequency-Aware Component Placement for Superconducting Quantum Computers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17450","snapshot_observed_at":"2026-08-15T22:36:42.436933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.436933Z"},"links":{"cited_paper":"/paper/2401.17450","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:500d3adb654f4a6a38f24e5ec3c3f21a0ccd142e5f49d4c623716669effc2c27","observation_id":"0c60819d-faaa-4ca9-b939-0cad6dba670d","resolution":{"observed_at":"2026-08-15T22:36:42.436933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-15T22:36:42.159428Z","title":"arXiv:1911.11641 [cs.CL] https://arxiv.org/abs/1911.11641","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.159428Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:bfc9e5182afa134c2ac8b3a0464323a19443e3ac93b710f638d0210c85fb697a","observation_id":"55673ec5-571b-488b-9c6c-d0ab1bf27d3a","resolution":{"observed_at":"2026-08-15T22:36:42.159428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10438","last_updated":"2024-03-29T19:21:58Z","snapshot_observed_at":"2026-08-16T16:15:00.962632Z","submitted_at":"2022-11-18T18:59:33Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10438","snapshot_observed_at":"2026-08-15T22:36:42.416370Z","title":"arXiv:2211.10438 [cs.CL] https://arxiv.org/abs/2211.10438","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.416370Z"},"links":{"cited_paper":"/paper/2211.10438","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:cdf973298f5faf7ff64c8f2fa2e9f0b902cff9a481bb264efa6105a5b6fd65ab","observation_id":"18894168-e18e-4da5-90f4-cf39fb7aec54","resolution":{"observed_at":"2026-08-15T22:36:42.416370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:36:42.222971Z","title":"https://doi.org/10.1109/MCAS.2024.3476008","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.222971Z"},"links":{"citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:4714726f67695a647c9f87d7f6d486ac7a30f6bc0b1eaeff3679f571e165e1a7","observation_id":"a243c6b4-75f8-42d5-a34e-428b35f5f34c","resolution":{"observed_at":"2026-08-15T22:36:42.222971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-17T08:40:41.866538Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2505.06901."}