{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba339ca943cf2263af45f9189dc1f449526275b6c84a3352d5b04ca1a0391b34","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:09.969345Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:47:31.653881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T06:16:20.379382Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"cited_work":{"arxiv_id":"2506.04642","doi":"10.48550/arxiv.2506.04642","metadata_source":"pith","pith_arxiv_id":"2506.04642","snapshot_observed_at":"2026-08-05T06:16:20.379382Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","venue":"cs.CL","work_id":"dc013872-a0be-4445-96b3-75771b61b594","year":2025},"citing_paper":{"arxiv_id":"2608.00528","last_updated":"2026-08-01T08:41:29Z","snapshot_observed_at":"2026-08-07T12:21:47.874302Z","submitted_at":"2026-08-01T08:41:29Z","title":"S$^4$R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T00:47:31.653881Z"},"links":{"cited_paper":"/paper/2506.04642","citing_paper":"/paper/2608.00528"},"observation_digest":"sha256:2e29ae023e2b029cab5e5a8087a08a7db99737db97400f4f4e4d6f4d0b52459a","observation_id":"2d0a32dc-d528-42fe-83d6-2749609e6e03","resolution":{"observed_at":"2026-08-05T00:47:32.072537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T23:38:13.098341+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T23:38:13.098341+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T23:38:13.098341+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04642/citation-record","integrity":"/paper/2506.04642/integrity","json":"/paper/2506.04642/citation-record.json","paper":"/paper/2506.04642"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T10:45:09.814940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.814940Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:6ea23741805b48529f7d2f8a6af1d02ca16e0c3e9ba8dd2c711a68643e415bc0","observation_id":"95ddf0a1-0c66-4313-9ee2-d46877579bad","resolution":{"observed_at":"2026-08-07T10:45:09.814940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.820633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.820633Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:fbfc48d3441a140b32ffb75c41b0e3a78f458699e7a651858c5cdebd08e33440","observation_id":"269b8026-bb4a-49c8-85a8-2ccdac6e1ca7","resolution":{"observed_at":"2026-08-07T10:45:09.820633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T10:45:09.825323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.825323Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:7a62fe7039e86c67543bd7abae13d340ad3e5699c85f273c03d487b90d3f73ef","observation_id":"484ef146-5291-4782-9dd0-fdc49ba24a4b","resolution":{"observed_at":"2026-08-07T10:45:09.825323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T10:45:09.832690Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.832690Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:699fc904e206ea412a0e2adb8e71fa630e238d690d09a0211033100c832f8c48","observation_id":"3ff40ad3-f55c-46db-926c-d51afbbd0020","resolution":{"observed_at":"2026-08-07T10:45:09.832690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T10:45:09.837526Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.837526Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:880a2dc3120f1d336c3709b49a3a28147cf0aa0f5b638af12f24ba049106ff3a","observation_id":"f11cb9aa-bcc5-4735-a342-3b24f0178fc2","resolution":{"observed_at":"2026-08-07T10:45:09.837526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T10:45:09.842117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.842117Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:9d1a580681d6d0bc5b909dc533f06c00ccb8948f38a71218819b8bbda0551e2f","observation_id":"352a4bf6-f68e-4646-98a1-65937f420473","resolution":{"observed_at":"2026-08-07T10:45:09.842117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-07T10:45:09.847376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.847376Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:fb3c01a4efea83723347233f0083d221923390ec110e5f13dad1c1af4fd9b79f","observation_id":"b3e9de94-c814-45eb-be2e-14625b18e067","resolution":{"observed_at":"2026-08-07T10:45:09.847376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:45:09.852555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.852555Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:4f2bdd6687f09065eed8f17a800107e667ddc117b25f0c12506d1b2c9fff5363","observation_id":"5bd22f1a-af28-459a-9ec7-6ad28740fc42","resolution":{"observed_at":"2026-08-07T10:45:09.852555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-07-06T16:42:12.176043Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-08-07T10:45:09.857737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.857737Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:4079e1be21fe909928f61351bb0421dd8df5c4deeaa5791b8eab92b399711454","observation_id":"ac17d14e-2ccb-4c22-adc6-cccc746d29ca","resolution":{"observed_at":"2026-08-07T10:45:09.857737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T10:45:09.862820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.862820Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:5b12572b890978d41923089efab91dd062e4aac3b9b4f3ea2f8b55d12385848e","observation_id":"dec87567-bce7-4b01-9448-54d41b907068","resolution":{"observed_at":"2026-08-07T10:45:09.862820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T10:45:09.868431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.868431Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:60382df1a521e81a5cab31bd1de9b7fa8964a95de4fee105f55f9f9a219c6387","observation_id":"2d192574-f02b-4608-8b1f-b3895ab9bcc1","resolution":{"observed_at":"2026-08-07T10:45:09.868431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10247","last_updated":"2024-06-08T07:49:55Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-08T07:49:55Z","title":"QCQA: Quality and Capacity-aware grouped Query Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10247","snapshot_observed_at":"2026-08-07T10:45:09.873091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.873091Z"},"links":{"cited_paper":"/paper/2406.10247","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:3e32c7adcd6d6679bd1fdd51afae39e4d2061a39a0a6956ce7a2cf203c6b4963","observation_id":"dac99d7f-cb4a-4bca-8a6d-92b8b0ae33c7","resolution":{"observed_at":"2026-08-07T10:45:09.873091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-07T10:45:09.879572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.879572Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:6848cd7b726cd087ba11fa1708b691e48bcacf4c28b02e49cc421cff642ebbb1","observation_id":"d693ca11-8206-4880-b0da-41d86b5d3cf7","resolution":{"observed_at":"2026-08-07T10:45:09.879572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.750047Z","title":null,"venue":null,"work_id":"a1ff5091-0c24-4091-8b04-113546f5d844","year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.884072Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:7e09d118410ae573cfa2e93f8fcdf9ea05ac365bc220f8760f8dd91d62801dc3","observation_id":"e40f040f-1e6d-45c2-ab28-b6db27918ed3","resolution":{"observed_at":"2026-08-07T10:45:10.757623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.728253Z","title":null,"venue":null,"work_id":"a604a298-92fc-4991-aecc-dc0cd190d2e0","year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.889818Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:d4d4fff733c15db79b0ea75c62b740536f2084a9752f8c3a8f5f3c769c97a7c4","observation_id":"3b2606d6-5df9-419f-af99-9e6c5e097be2","resolution":{"observed_at":"2026-08-07T10:45:10.733674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.709939Z","title":null,"venue":null,"work_id":"69610dcf-151a-4dc3-97cd-8a6da49b4c08","year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.896238Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:9b22ab61433e96147dfa3b90e905e6b98af91337e50052b238e2a94f32971cee","observation_id":"74362e38-9bcc-4d39-8626-bfe1b68a55ea","resolution":{"observed_at":"2026-08-07T10:45:10.715024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T10:45:09.901527Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.901527Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:06f65b929785b2ad07554fc7efcaf88863382b9907c791088181c4117a7fae93","observation_id":"5f34c911-4420-46cd-a5ae-21abb5158006","resolution":{"observed_at":"2026-08-07T10:45:09.901527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-08-06T08:43:40.051791Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-07T10:45:09.907446Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.907446Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:35c7953af3d803462451342c817de1ae515c2c118b833bcd3acf2f9d6b6cb773","observation_id":"c9696f4f-1dba-44c6-8b5a-95c3d630a868","resolution":{"observed_at":"2026-08-07T10:45:09.907446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T10:45:09.914455Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.914455Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:4a07ced9d2b57ccedb945b6706d3347463da553942a68893e88499906e66425c","observation_id":"59a20d92-ce06-48fe-866a-4610cd1b7b11","resolution":{"observed_at":"2026-08-07T10:45:09.914455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.920790Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.920790Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:8c033442e63cf46d2be70d95fa8a4c171dfd1e31212da1a029a99490854085c7","observation_id":"d6cb2726-e83b-48eb-b906-833c6a995ec5","resolution":{"observed_at":"2026-08-07T10:45:09.920790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:45:09.926851Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.926851Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:2628f1ce42864931037ab006d4c370acdc8e6c27500b5e6ed2f4fb793fe3a14c","observation_id":"1396b045-3cf4-47a9-a74b-d7326c79c876","resolution":{"observed_at":"2026-08-07T10:45:09.926851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.688641Z","title":null,"venue":null,"work_id":"cf549b62-87ed-4788-953b-f5a9915dfb91","year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.933063Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:b276fb10d85525e828d616bd5d617489bb3fb73a0e876f2dd318b5c2715f6872","observation_id":"a773ade7-6a5e-4d4b-bb47-81844a9ece5c","resolution":{"observed_at":"2026-08-07T10:45:10.695637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T10:45:09.938312Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.938312Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:6aef50d8416c495efd3453454a90f9592b710f01e33e6fa1666b90fb60b08e0f","observation_id":"1a3c3d1d-0243-40c2-ab7c-11379f14c19f","resolution":{"observed_at":"2026-08-07T10:45:09.938312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.943240Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.943240Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:d8515186f93188f1f29b9e2b2a9d0794d79e60e0334ffd48e924c1f6dd05fe0d","observation_id":"bd5e42cf-18cb-4fea-9e28-bde12a9c36a8","resolution":{"observed_at":"2026-08-07T10:45:09.943240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-07T10:45:09.947823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.947823Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:545cbd5780486bfa3d2d9206c9e24d148fd993c13b208ec29d9307ba1ba72777","observation_id":"0f93231f-9814-4dc5-85c4-ecb43a2b7e43","resolution":{"observed_at":"2026-08-07T10:45:09.947823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13369","last_updated":"2020-10-26T06:50:07Z","snapshot_observed_at":"2026-07-06T10:08:27.055672Z","submitted_at":"2020-10-26T06:50:07Z","title":"Accelerating Training of Transformer-Based Language Models with Progressive Layer Dropping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13369","snapshot_observed_at":"2026-08-07T10:45:09.952447Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.952447Z"},"links":{"cited_paper":"/paper/2010.13369","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:68734dc7a7bb7c5eaa27c8d2601ecbee70478a5956d22502efc962f28280c389","observation_id":"2c7daa70-4d90-4fdb-8a50-23d4b97d8245","resolution":{"observed_at":"2026-08-07T10:45:09.952447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.634409Z","title":null,"venue":null,"work_id":"4957c481-0f9d-4f3d-b319-fd8ca7bf357b","year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.957404Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:1ee7d422390b46a0bfad689b245bb367e933e6fa29ecdf66af6ac196966c59dd","observation_id":"ee8404e7-937d-4390-a1da-bb201b4e0a22","resolution":{"observed_at":"2026-08-07T10:45:10.649641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.964123Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.964123Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:e23c54b675235c2bc05175c3208d715e4a3cf12f59a309273dc679986d198fb3","observation_id":"8a744468-b86b-4f68-96bc-c8900601386b","resolution":{"observed_at":"2026-08-07T10:45:09.964123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.969345Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.969345Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:b8cda7ea31b3c6d199d6109310bcfad26c3decd10d0fdff7b5eec69400eae5bf","observation_id":"1c9ebf99-05a5-4efc-9c46-b326a0197ddf","resolution":{"observed_at":"2026-08-07T10:45:09.969345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:20:55.064261Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2506.04642."}