{"as_of":"2026-08-08T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28de3383105cc1e3b074db065d8314cd6d58d5cad939436da4111ac64a868134","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:15:08.413962Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00797/citation-record","integrity":"/paper/2507.00797/integrity","json":"/paper/2507.00797/citation-record.json","paper":"/paper/2507.00797"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:15:07.849464Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.849464Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:b44638501df35d3d6d3946551a0d362ba3d56d9ce017e0d548d7d58600a979af","observation_id":"82e96aaf-b95a-4a4a-92a5-11c2a30b477d","resolution":{"observed_at":"2026-08-06T21:15:07.849464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:09.308737Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference,","venue":null,"work_id":"f86543e8-0845-4df6-945f-745f882e66ea","year":2024},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.859756Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:c6e12deec970e1684da19cf830ddfdf73e5634a60f4fbb3b25c940161f7803a4","observation_id":"72b6c78e-1280-462d-a626-1b509ed01e59","resolution":{"observed_at":"2026-08-06T21:15:09.326845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:09.233958Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"136e522c-0f17-4644-a04c-33693f0043f7","year":2022},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.881035Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:78806b837b797f953828582e2aeb3a1a31dd288d86eb934d596602f7706c0ad5","observation_id":"f0a9f903-772b-4d81-ba86-1f5b0b72b145","resolution":{"observed_at":"2026-08-06T21:15:09.260429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T21:15:07.905855Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.905855Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:7a260cdba78d25876af4cee68cc7176f8546fc529e8bf42de5d402f25ca07a5e","observation_id":"1f6b3c51-5858-4aa2-aa87-8a6e3bdecb84","resolution":{"observed_at":"2026-08-06T21:15:07.905855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:15:07.925788Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.925788Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:69e42e9f7266940215b1d74993708111836cd365e9e602ebfc38ab5e56215dc5","observation_id":"af994ca5-914f-436a-ba39-997971429553","resolution":{"observed_at":"2026-08-06T21:15:07.925788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:07.936932Z","title":"Aˆ 3: Accelerating attention mechanisms in neural networks with approximation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.936932Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:58eeaae49bc6b98048cf4f3341a1ce1f672a171ceb8bc758592cf806230bb841","observation_id":"a266e578-3faf-4682-8594-a64aaca11cd0","resolution":{"observed_at":"2026-08-06T21:15:07.936932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:09.080410Z","title":"Ramulator: A fast and extensible dram simulator,","venue":null,"work_id":"ad10bb62-dc8d-4370-9876-df8cc67fee1a","year":2015},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.946905Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:4f1bcb52b959d1b539ed29375360ea5702078265e9b4f8468202a7c76d391eb6","observation_id":"bce1e27a-5595-499d-b96d-16313904e1ae","resolution":{"observed_at":"2026-08-06T21:15:09.122654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:09.004347Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time,","venue":null,"work_id":"44013551-3375-4c2a-9627-8f2e0fb85d7b","year":2024},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.979589Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:aef032b466cf0fc95f00ea195d2da442885e471dae59711257c0da3e35cd90d8","observation_id":"c13cd7a9-0e80-45d4-a83b-1f4ead0f21e0","resolution":{"observed_at":"2026-08-06T21:15:09.045540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.927282Z","title":"Sanger: A co-design framework for enabling sparse attention using reconfigurable architecture,","venue":null,"work_id":"8a814136-82b3-498e-b0b9-e05bd243e829","year":2021},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:07.998054Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:50d306d689197fa06bf05309a66c30ac4b1385c1a348ed03d90c2045526e14ce","observation_id":"8c532b4d-d698-4c75-91b7-32fba6c84da2","resolution":{"observed_at":"2026-08-06T21:15:08.952344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-06T21:15:08.020611Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.020611Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:80082722fd9b34bce3aec0125214017378abc71fe5d8aec47cd4d19b7d533122","observation_id":"17c0dbb8-0ca1-4db4-ac07-30d9a18fb3bc","resolution":{"observed_at":"2026-08-06T21:15:08.020611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.816616Z","title":"Cacti 6.0: A tool to model large caches,","venue":null,"work_id":"1b4fdd69-dcaa-4a97-aecb-57a569d6d468","year":2009},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.049142Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:e3e999a268ed19f1e256fb1efe07ef241346704cdfd5434a6ea0c51031f1b9e2","observation_id":"2727282a-607f-4d4a-ad12-ec698b5a3a26","resolution":{"observed_at":"2026-08-06T21:15:08.845873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-06T21:15:08.085353Z","title":"Com- pressive transformers for long-range sequence modelling,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.085353Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:2a35a21516741b4bcda09a62d85e011ebc0e1f7ef3b08bc4ce180927fec599a5","observation_id":"cfb3fef2-0844-4581-9a1c-100168a196e5","resolution":{"observed_at":"2026-08-06T21:15:08.085353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.750663Z","title":"Deepscaletool: A tool for the accurate esti- mation of technology scaling in the deep-submicron era,","venue":null,"work_id":"710ead4d-b736-4059-8b5c-f960f0c416a5","year":2021},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.129401Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:178b2516cd32ea8105bf5f297524ea52d5bb97af9d91128d5c9fab323e8dc531","observation_id":"4613ce40-fd13-4dfe-b3a6-1785a1e4d68f","resolution":{"observed_at":"2026-08-06T21:15:08.788210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.166263Z","title":"Softermax: Hardware/software co-design of an efficient softmax for transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.166263Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:367b31c6881204b14dfcbbedec1e18576b849270cc459453285b7908f8a49987","observation_id":"695b8885-89e2-48f5-ae99-a1b45604d5f1","resolution":{"observed_at":"2026-08-06T21:15:08.166263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T21:15:08.202870Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.202870Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:498d143cf991e3cbd9acae5f57df29bf874d57abe02e34d77894fdfa5f3d76de","observation_id":"39010cac-1c04-4604-bd31-4cd13cf2be2a","resolution":{"observed_at":"2026-08-06T21:15:08.202870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.237183Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.237183Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:1586492ea3d092c0d4333eed5748f379f1593efc562dd08d5605d13c6cae7367","observation_id":"06dcc06d-a9e5-492e-b322-38fc81ecfe8a","resolution":{"observed_at":"2026-08-06T21:15:08.237183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.665431Z","title":"Cosa: Co-operative systolic arrays for multi-head attention mechanism in neural network using hybrid data reuse and fusion methodologies,","venue":null,"work_id":"9acca869-17c1-4f41-b4aa-7391de1946d1","year":2023},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.274907Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:a094fd7594486ff60228fa158b99b5fa300e05c63a71e13b1c31bcbd504129cb","observation_id":"77954335-5988-4f1b-bf7e-71adab422002","resolution":{"observed_at":"2026-08-06T21:15:08.695573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T21:15:08.309519Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.309519Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:842e0c41fd8f90b8761e95d5ade381c89d3c108eeaf9b656ff8c9da82ae1db17","observation_id":"6f659055-ae9e-4c17-9b50-cecc7f8b9193","resolution":{"observed_at":"2026-08-06T21:15:08.309519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.623643Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models,","venue":null,"work_id":"2c430b01-07a0-4da8-8ebf-ec4674267dd3","year":2022},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.345273Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:72bb5709d1c3c3631ad6e5fcd5e6c30e417f940fd1800c4646412af994a60f61","observation_id":"7a12d836-3440-47af-b3b7-859070fee557","resolution":{"observed_at":"2026-08-06T21:15:08.638398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.02191","last_updated":"2021-12-03T23:06:57Z","snapshot_observed_at":"2026-07-06T12:15:13.803759Z","submitted_at":"2021-12-03T23:06:57Z","title":"NN-LUT: Neural Approximation of Non-Linear Operations for Efficient Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.02191","snapshot_observed_at":"2026-08-06T21:15:08.374201Z","title":"Nn-lut: Neural approximation of non-linear operations for efficient transformer inference,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.374201Z"},"links":{"cited_paper":"/paper/2112.02191","citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:af8ed398a7fff5725a35293f1e0e9cb0b498c24366738c7a31537e8358576ab7","observation_id":"4e5f3e1d-e7ca-41e7-b216-ccac6a4f76db","resolution":{"observed_at":"2026-08-06T21:15:08.374201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:15:08.413962Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:15:08.413962Z"},"links":{"citing_paper":"/paper/2507.00797"},"observation_digest":"sha256:8fdd6197d748058218b2a9dc3b4d8cbbd5fba6494b80c03e0be40bb5505714e2","observation_id":"9d67cf50-a008-43ef-8f0b-22996fae256b","resolution":{"observed_at":"2026-08-06T21:15:08.413962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00797","last_updated":"2025-07-01T14:30:31Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-06T21:04:40.135706Z","submitted_at":"2025-07-01T14:30:31Z","title":"VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2507.00797."}