{"as_of":"2026-08-16T15:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5242ac6e55663f80c50bf6589894a9be74867b2e9dae9f74b7b93cc2397abb81","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:40:37.861863Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.19549/citation-record","integrity":"/paper/2506.19549/integrity","json":"/paper/2506.19549/citation-record.json","paper":"/paper/2506.19549"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-08-14T07:01:16.499526Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-15T18:40:37.570396Z","title":"Quantifying attention flow in transformers.arXiv preprint arXiv:2005.00928, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.570396Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:d2ae9d042b76701ebfb4a3cc51d57c1e94dac720d118b83e6075e66733f8fc21","observation_id":"8012e4f4-718b-4f8d-9d90-23f187f973af","resolution":{"observed_at":"2026-08-15T18:40:37.570396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15734","last_updated":"2025-02-05T14:12:33Z","snapshot_observed_at":"2026-08-13T04:33:17.001464Z","submitted_at":"2025-02-05T14:12:33Z","title":"Cache-Craft: Managing Chunk-Caches for Efficient Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15734","snapshot_observed_at":"2026-08-15T18:40:37.576655Z","title":"Cache-craft: Managing chunk-caches for efficient retrieval-augmented generation.arXiv preprint arXiv:2502.15734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.576655Z"},"links":{"cited_paper":"/paper/2502.15734","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:f738200f5a663b74a988443330897e76ee03f1709281f0cff603de3467c81248","observation_id":"1f2c6f46-961e-4a68-8afa-f1e5d2097c38","resolution":{"observed_at":"2026-08-15T18:40:37.576655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.791550Z","title":"Circuit tracing: Revealing computational graphs in language models.Transformer Circuits Thread, 2025","venue":null,"work_id":"3c029117-6e12-4e93-953a-43188c1906f1","year":2025},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.582252Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:4e50b6d65a0cae2b16c0343d7a2d02f7c4827dd8792adc1c91fd841ecad20ca2","observation_id":"daa129d7-3739-4faa-bc00-bcaee7f2294f","resolution":{"observed_at":"2026-08-15T18:40:38.796518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.775623Z","title":"Why the 1-wasserstein distance is the area between the two marginal cdfs, 2021","venue":null,"work_id":"38437f13-fa9b-40e8-a848-ddbb11b93819","year":2021},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.587332Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:ac31936147919c41e0fb6dc6a89685ba247344edf4a30039c502190f32b5401e","observation_id":"e9752e9e-b34f-49a5-aeab-4710489e18ab","resolution":{"observed_at":"2026-08-15T18:40:38.780543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.759525Z","title":"Mechanistic interpretability meets vision language models: Insights and challenges","venue":null,"work_id":"f7ea94be-0fc2-4c08-94e0-9721a4e64eea","year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.592224Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:dbb328edd245477e67be16c5a89b4016e292af7a797bcca3c679e44ee3f8039a","observation_id":"43733609-b192-46e5-a7c8-d50410433164","resolution":{"observed_at":"2026-08-15T18:40:38.764644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-15T18:40:37.597109Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling.arXiv preprint arXiv:2406.02069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.597109Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:1b413cf8701dea9df04139746ae3f980b75b4fd3b457c1ef7226fe5cb32397ec","observation_id":"9741ce28-a327-4d05-94ac-605cba6bbef5","resolution":{"observed_at":"2026-08-15T18:40:37.597109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-15T18:40:37.603820Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.603820Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:4f01ef9f63a5d1102200f6503f364696f853eee405ea137c72aa0ecb1e5e82e3","observation_id":"11c2edea-ccd7-4683-aea8-76ea40ffa21c","resolution":{"observed_at":"2026-08-15T18:40:37.603820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08968","last_updated":"2024-03-29T22:14:30Z","snapshot_observed_at":"2026-08-16T14:43:05.025537Z","submitted_at":"2023-11-15T14:01:41Z","title":"Identifying Linear Relational Concepts in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08968","snapshot_observed_at":"2026-08-15T18:40:37.608655Z","title":"Identifying linear relational concepts in large language models.arXiv preprint arXiv:2311.08968, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.608655Z"},"links":{"cited_paper":"/paper/2311.08968","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:8a05ca66ccfd1fffee3647331bb49abd051792a81094b2e5b1af71652ab0c2be","observation_id":"5328d520-3ebf-49c3-8bc7-32db8addeb22","resolution":{"observed_at":"2026-08-15T18:40:37.608655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.613666Z","title":"Transformer interpretability beyond attention visualization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.613666Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:0cdbfe565eae3c2533ce034d483b167c12030716bd6c244acd3eca46663cefed","observation_id":"27d4b52f-adfc-4b75-a52e-46c442caf4eb","resolution":{"observed_at":"2026-08-15T18:40:37.613666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07071","last_updated":"2024-10-03T17:26:48Z","snapshot_observed_at":"2026-08-16T13:35:41.200277Z","submitted_at":"2024-07-09T17:44:34Z","title":"Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07071","snapshot_observed_at":"2026-08-15T18:40:37.618938Z","title":"Lookback lens: Detecting and mitigating contextual hallucinations in large language models using only attention maps.arXiv preprint arXiv:2407.07071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.618938Z"},"links":{"cited_paper":"/paper/2407.07071","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:e3252d629d3d1ed3d3757868359b9da0beb80e39b906119fba7cbeff7a4cff96","observation_id":"d05fc0bd-2aaa-4676-b350-d8b46a267a92","resolution":{"observed_at":"2026-08-15T18:40:37.618938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13752","last_updated":"2025-04-18T15:36:28Z","snapshot_observed_at":"2026-08-16T11:58:43.236911Z","submitted_at":"2025-04-18T15:36:28Z","title":"Learning to Attribute with Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13752","snapshot_observed_at":"2026-08-15T18:40:37.624351Z","title":"Learning to attribute with attention.arXiv preprint arXiv:2504.13752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.624351Z"},"links":{"cited_paper":"/paper/2504.13752","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:db24b951cd67cbf7a66224b8848593d991c83dfb0352f2f8b2b58c921ea7ec8d","observation_id":"d19af99b-580d-4b2b-9f10-a19e4aa77687","resolution":{"observed_at":"2026-08-15T18:40:37.624351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11430","last_updated":"2024-11-03T09:42:35Z","snapshot_observed_at":"2026-08-16T13:42:18.939109Z","submitted_at":"2024-06-17T11:35:16Z","title":"A Simple and Effective $L_2$ Norm-Based Strategy for KV Cache Compression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11430","snapshot_observed_at":"2026-08-15T18:40:37.629546Z","title":"A simple and effective l 2norm-based strategy for kv cache compression.arXiv preprint arXiv:2406.11430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.629546Z"},"links":{"cited_paper":"/paper/2406.11430","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:fedc0b6fbd4312f9bc77918295974a8028e3c21f4cdb108652f64d817665d8ae","observation_id":"8e458e79-6ee5-43b4-a2eb-8b7260bb0e76","resolution":{"observed_at":"2026-08-15T18:40:37.629546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09398","last_updated":"2024-06-12T06:08:58Z","snapshot_observed_at":"2026-08-16T14:18:32.221556Z","submitted_at":"2024-02-14T18:54:56Z","title":"Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09398","snapshot_observed_at":"2026-08-15T18:40:37.634455Z","title":"Get more with less: Synthesizing recurrence with kv cache compression for efficient llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.634455Z"},"links":{"cited_paper":"/paper/2402.09398","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:332164612b83b97a67f8400a1649d807071dbb8d1735858224d3f5d2006dce34","observation_id":"7fcf1d28-fe4a-4a9b-8672-6af3e98962f2","resolution":{"observed_at":"2026-08-15T18:40:37.634455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07108","last_updated":"2025-01-13T07:42:55Z","snapshot_observed_at":"2026-08-16T12:59:07.726886Z","submitted_at":"2025-01-13T07:42:55Z","title":"How GPT learns layer by layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07108","snapshot_observed_at":"2026-08-15T18:40:37.639598Z","title":"How gpt learns layer by layer.arXiv preprint arXiv:2501.07108, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.639598Z"},"links":{"cited_paper":"/paper/2501.07108","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:1afcc19fbcd61875a12f8b4948ee9fe1c915e4017fa3b3bd0adfa59fdc62ec54","observation_id":"01533202-e92c-4774-9313-1cfca8857501","resolution":{"observed_at":"2026-08-15T18:40:37.639598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.731338Z","title":"Position information in transformers: An overview.Computational Linguistics, 48(3):733–763, 2022","venue":null,"work_id":"36fe9e3e-dcdc-484e-8e6e-3e046460b89a","year":2022},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.645764Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:15f19ea4cf684a213a9a828adceb4a112e44325824527234e6daeba63a5fbb55","observation_id":"3f9b1559-c872-4a36-82da-c6fec655bdd5","resolution":{"observed_at":"2026-08-15T18:40:38.736385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11944","last_updated":"2024-11-06T22:37:30Z","snapshot_observed_at":"2026-08-16T13:42:08.334213Z","submitted_at":"2024-06-17T17:49:00Z","title":"Transcoders Find Interpretable LLM Feature Circuits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11944","snapshot_observed_at":"2026-08-15T18:40:37.650165Z","title":"Transcoders find interpretable llm feature circuits.arXiv preprint arXiv:2406.11944, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.650165Z"},"links":{"cited_paper":"/paper/2406.11944","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:78c98c36c0e1bb254030841ecd6e565e65a8ddd7d1a8b95b3825db713ddfda3a","observation_id":"305bf029-f788-413c-a67e-86e59700806e","resolution":{"observed_at":"2026-08-15T18:40:37.650165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.715158Z","title":"Copula theory: An introduction","venue":null,"work_id":"586ce3d4-bb33-47a6-bce3-98f659a15f80","year":2010},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.654779Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:c77d81eca99116244032ca148893ae041bc0ae2e47f59c7cc01985a5de2da6bd","observation_id":"1e339df4-d7cd-4b83-8e2a-49ae263bbb81","resolution":{"observed_at":"2026-08-15T18:40:38.720002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.698424Z","title":"On the biology of a large language model,","venue":null,"work_id":"3bb5d5d6-ab42-4aec-95a0-2f009a4a7ab8","year":null},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.659860Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:bbb3ac17cfda8a254b468764098540f5f8481164e5e700c9fa034e594c374d0e","observation_id":"aef9e929-03a3-4ec7-8dd0-5effa61bb1e4","resolution":{"observed_at":"2026-08-15T18:40:38.703890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06085","last_updated":"2023-06-09T17:48:54Z","snapshot_observed_at":"2026-08-16T15:25:04.317088Z","submitted_at":"2023-06-09T17:48:54Z","title":"Trapping LLM Hallucinations Using Tagged Context Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06085","snapshot_observed_at":"2026-08-15T18:40:37.669580Z","title":"Trapping llm hallucinations using tagged context prompts.arXiv preprint arXiv:2306.06085, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.669580Z"},"links":{"cited_paper":"/paper/2306.06085","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:e8e1ffd9ba89e8a584677add787ce7900bcc284746a9bd7a0281fd3cdf3b6495","observation_id":"cab9cd1a-069c-4f9d-b78a-55572332d3a3","resolution":{"observed_at":"2026-08-15T18:40:37.669580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-15T18:40:37.674575Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference.arXiv preprint arXiv:2407.11550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.674575Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:8a13f4020d4abe5dc73da8b97682b810291a2ba96458d27a7c0bdc9c6e55c644","observation_id":"ac782359-d5a0-4a63-bc1e-bd32b18bedda","resolution":{"observed_at":"2026-08-15T18:40:37.674575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.666462Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":"a42c6c64-9433-4bfb-87bf-49b055487908","year":null},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.679710Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:f310fe62be77d520d77f21db5e14e17e382ba4a4cb571b0f1f5d0cdbfcfc1ed5","observation_id":"7381500d-960b-4156-850e-6bbc21d4063f","resolution":{"observed_at":"2026-08-15T18:40:38.671550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02812","last_updated":"2025-03-04T17:37:49Z","snapshot_observed_at":"2026-08-16T12:53:08.015543Z","submitted_at":"2025-03-04T17:37:49Z","title":"Q-Filters: Leveraging QK Geometry for Efficient KV Cache Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02812","snapshot_observed_at":"2026-08-15T18:40:37.684583Z","title":"Q-filters: Leveraging qk geometry for efficient kv cache compres- sion.arXiv preprint arXiv:2503.02812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.684583Z"},"links":{"cited_paper":"/paper/2503.02812","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:f1440b69c0f056e2e6893f194b8ea6cacad11e613d52df3faacbe057bca1c0e6","observation_id":"b4d8b362-6db2-48ed-b96c-c6572bfe853c","resolution":{"observed_at":"2026-08-15T18:40:37.684583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T18:40:37.689409Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.689409Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:499d5c29194c11a2fef5d14e34e5f92e5d3f0eb8eded83fc7575c68f52df420f","observation_id":"e24723c4-db29-4af9-9f46-d041e08ed93e","resolution":{"observed_at":"2026-08-15T18:40:37.689409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-15T18:40:37.693954Z","title":"When attention sink emerges in language models: An empirical view.arXiv preprint arXiv:2410.10781, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.693954Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:1cb2660b25aceddddadf7f147c64910e3857a88b4dd3bb7d11450e994a222030","observation_id":"1aed923a-ce24-43cf-a0cf-9ee599b2ab65","resolution":{"observed_at":"2026-08-15T18:40:37.693954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.649402Z","title":"Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":"ff53eb43-240d-450a-b8cf-15f3d7dce2c6","year":null},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.699286Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:68d0c7edc4966ad3fa24ea5b672908e4bf3ee26f0e1e4306920773c890cc2fea","observation_id":"c6cf9256-9a67-49ec-87ed-8b344c4f9e32","resolution":{"observed_at":"2026-08-15T18:40:38.654875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.704381Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.704381Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:8fb0445ae390c17980ed9c09243d713c1cb4e5ea388bd943aa18b59c6a3e9838","observation_id":"dfe67b36-4ffb-4727-9f85-09d4f5178f48","resolution":{"observed_at":"2026-08-15T18:40:37.704381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.622386Z","title":null,"venue":null,"work_id":"0e0da563-643f-482a-a183-e1ae6e12aeca","year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.710095Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:12bb7337d9a165eb5c074fb5e7f47ad1746ec0a35fea6621f9e59f1b8cc8d28c","observation_id":"b9deb93a-3755-4163-bd4e-9e5659880ff6","resolution":{"observed_at":"2026-08-15T18:40:38.627391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-15T18:40:37.714828Z","title":"A survey on large language model acceleration based on kv cache management.arXiv preprint arXiv:2412.19442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.714828Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:19a390421166598774029d1e5d7ec2b7297bfab05a9772672099bf8f7d7935eb","observation_id":"9cb4cfdc-3873-4802-acbe-9cdfdcd47dc7","resolution":{"observed_at":"2026-08-15T18:40:37.714828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.604976Z","title":"Attributionbench: How hard is automatic attribution evaluation?, 2024","venue":null,"work_id":"1714ced6-d77d-456e-bef6-99e119218133","year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.721179Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:5deceb494b518e585133cf14e4e40de7bffbd1b8d670478c149989c24938e85d","observation_id":"6a4790b3-9196-4544-8c64-350b0d678dcc","resolution":{"observed_at":"2026-08-15T18:40:38.610575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.726278Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.726278Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:c3e4f4fb4386e8dc20d29c9f9a6de0902e336c971ac2c0c0f924b2184deeb996","observation_id":"c9814314-a471-4f53-8c83-39f247c467f6","resolution":{"observed_at":"2026-08-15T18:40:37.726278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14731","last_updated":"2025-05-16T09:40:01Z","snapshot_observed_at":"2026-08-16T13:08:53.566354Z","submitted_at":"2024-10-16T08:34:51Z","title":"MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14731","snapshot_observed_at":"2026-08-15T18:40:37.730963Z","title":"Matryoshkakv: Adaptive kv compression via trainable orthogonal projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.730963Z"},"links":{"cited_paper":"/paper/2410.14731","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:103b469d63f949d41a891ab9787dfb1e6b953a91f851b8f9a920b3328ae9eac6","observation_id":"4d668d59-d3ad-4d65-b31e-81391f3474b2","resolution":{"observed_at":"2026-08-15T18:40:37.730963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.735934Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.735934Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:a29252091c54de37d843181b4d0cdc6ef359d1fa83cfc836599dae509220517d","observation_id":"223f8241-51f4-4cf4-963a-d0c00e2c7ad2","resolution":{"observed_at":"2026-08-15T18:40:37.735934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.566383Z","title":"Minicache: Kv cache compression in depth dimension for large language models.Advances in Neural Information Processing Systems, 37:139997–140031, 2024","venue":null,"work_id":"738b78f1-dd22-4f2b-90be-2c90a72e46ab","year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.741138Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:6bb19c81d4de8f334386e0fee1a3ef31fd6ce978861597c51cadd94dceb654de","observation_id":"f6d89aa7-468d-472c-b1ad-aef4f68b73f4","resolution":{"observed_at":"2026-08-15T18:40:38.571792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.746469Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.746469Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:abcc0fd055085b9f6f8523b7514965d18529503ffb706e826601fa85d2cb2fe7","observation_id":"83e54ccf-66d2-4858-9cb6-5b4c8e0c8f94","resolution":{"observed_at":"2026-08-15T18:40:37.746469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.539667Z","title":"Kivi: a tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":"1f003553-dfe5-4fb5-90a1-d2c1d8547b70","year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.751221Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:7b8bcfac6f27e9a0c163b1a3bfe23858ea2aa2b6e7c7b731127a4cfdee3b5bb2","observation_id":"3669a79f-6b6d-48fb-977d-217bcb7884ed","resolution":{"observed_at":"2026-08-15T18:40:38.544805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.755801Z","title":"A unified approach to interpreting model predictions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.755801Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:4083de2e4d093633a244b1e0f7d10a9ea6e7f9eea4edc67375ea2549299527bb","observation_id":"553580ca-d447-4a6a-93cb-07129b91fb41","resolution":{"observed_at":"2026-08-15T18:40:37.755801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04625","last_updated":"2023-10-06T23:37:24Z","snapshot_observed_at":"2026-08-16T14:54:19.799018Z","submitted_at":"2023-10-06T23:37:24Z","title":"Copy Suppression: Comprehensively Understanding an Attention Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04625","snapshot_observed_at":"2026-08-15T18:40:37.760234Z","title":"Copy suppression: Comprehensively understanding an attention head.arXiv preprint arXiv:2310.04625, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.760234Z"},"links":{"cited_paper":"/paper/2310.04625","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:4dea3e26e130817f0137b1433e1b561545bcb3926dc4d6b17e3e1772b6accda4","observation_id":"ba88fbe6-d51e-4182-9a8e-9367bae4182c","resolution":{"observed_at":"2026-08-15T18:40:37.760234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05491","last_updated":"2023-12-09T07:35:24Z","snapshot_observed_at":"2026-08-16T14:36:20.277393Z","submitted_at":"2023-12-09T07:35:24Z","title":"Using Captum to Explain Generative Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05491","snapshot_observed_at":"2026-08-15T18:40:37.764958Z","title":"Using captum to explain generative language models.arXiv preprint arXiv:2312.05491, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.764958Z"},"links":{"cited_paper":"/paper/2312.05491","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:cf939bc751dff425437b233807b5a3f6cee12afeadb393a30d7c9faf354ccd28","observation_id":"4a63ae2b-d52e-489a-999c-d968f2f359d0","resolution":{"observed_at":"2026-08-15T18:40:37.764958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-15T09:43:59.961298Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-15T18:40:37.769717Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.769717Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:3dbb46094078d9e6f7d9ec0c601ad7674c5c0d8dc32e9a60f03e657ec8e26352","observation_id":"d5993c33-0524-4e41-b0ca-a3fe49eecb13","resolution":{"observed_at":"2026-08-15T18:40:37.769717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-16T14:28:08.030037Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-15T18:40:37.774232Z","title":"Transformers are multi-state rnns.arXiv preprint arXiv:2401.06104, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.774232Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:0d832142428148c5dabad2d4eddc52d8c88c657ba0dd617b427f6658376b19dd","observation_id":"9a364d7e-d5a4-4e9c-95c4-2246ae817c4b","resolution":{"observed_at":"2026-08-15T18:40:37.774232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.514183Z","title":"Peering into the mind of language models: An approach for attribution in contextual question answering","venue":null,"work_id":"d7f42ade-c31e-44c8-ba12-55e743f05be3","year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.779144Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:c4bae6c2831dfbe9bafa152427edff07aa494cde0c2393e56b577dff94161699","observation_id":"ed704e74-903a-4ec1-9b61-fc279e3eb3e0","resolution":{"observed_at":"2026-08-15T18:40:38.519400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.498287Z","title":"Explanations of deep language models explain language representations in the brain.arXiv e-prints, pages arXiv–2502, 2025","venue":null,"work_id":"a713c357-094f-4e29-b4c6-69c032a59c9a","year":2025},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.783424Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:44603341d346f0c1ad832e8bfac591ab86bdf0127640867af5d810c06ae05b62","observation_id":"2fbde6c1-98f3-48f5-9272-cb6cf9637235","resolution":{"observed_at":"2026-08-15T18:40:38.503969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-14T19:05:25.482398Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-15T18:40:37.787806Z","title":"Know what you don’t know: Unanswerable questions for squad.arXiv preprint arXiv:1806.03822, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.787806Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:6937c991051af976b3f083d41c1d553c16cd1a5e77e2307c9a633d96bc289b2c","observation_id":"8d4d2c5d-b597-47d9-a64a-29089508eeea","resolution":{"observed_at":"2026-08-15T18:40:37.787806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.481152Z","title":"On the efficacy of eviction policy for key-value constrained generative language model inference.CoRR, 2024","venue":null,"work_id":"fa638fcc-97fe-492a-98a4-d31ea23197e0","year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.792317Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:f664cf68c2e33f2d596feb48ef97a2e2f39ba2802e70e8e8df804aa89b498ffb","observation_id":"4ef857cf-fcbb-495c-abd8-ce1dcd52cc5d","resolution":{"observed_at":"2026-08-15T18:40:38.486911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.796727Z","title":"” why should i trust you?” explaining the predictions of any classifier","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.796727Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:9527dcfc96b0f582e127b4c43b40f70c8018b9913f43af2a5b6b1c97b0c4f830","observation_id":"2e1a404d-6b50-4246-b0e6-58bec4bfb7a4","resolution":{"observed_at":"2026-08-15T18:40:37.796727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.455156Z","title":"A primer in bertology: What we know about how bert works.Transactions of the association for computational linguistics, 8:842–866, 2021","venue":null,"work_id":"bd561181-8f64-427f-abee-99930333f249","year":2021},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.801417Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:0168def5692dc941aa1063fc187bf575cb3028d5e8c5286e748f65693430963a","observation_id":"90e9ab55-09e7-4bc6-8b36-f0139649037d","resolution":{"observed_at":"2026-08-15T18:40:38.460289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.439758Z","title":"Occam’s laser: Occlusion-based attribution maps for 3d object detectors on lidar data","venue":null,"work_id":"35161806-cb34-483c-bec2-fa9d47c3429c","year":2022},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.805834Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:4da19aab73295b7a6ef890e6de02949442ae3751e7b282241e68f49c6b4e4f9a","observation_id":"f5a3ccee-d3c3-4f44-b991-af7eb942878f","resolution":{"observed_at":"2026-08-15T18:40:38.444618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04886","last_updated":"2024-06-30T18:53:22Z","snapshot_observed_at":"2026-08-16T14:44:51.934962Z","submitted_at":"2023-11-08T18:46:32Z","title":"SEMQA: Semi-Extractive Multi-Source Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04886","snapshot_observed_at":"2026-08-15T18:40:37.810297Z","title":"Semqa: Semi-extractive multi-source question answering.arXiv preprint arXiv:2311.04886, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.810297Z"},"links":{"cited_paper":"/paper/2311.04886","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:43a0d1679fe5725a2dd1d33e8addabb1eff1ea11f4ef704f96ada8027873c3ff","observation_id":"f2c4f655-5d18-4e25-8e33-0504c43c1d50","resolution":{"observed_at":"2026-08-15T18:40:37.810297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.815534Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.815534Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:3353015720c1bed12b5f7d336c2556dfd7892edeee1124db933c4ba4c9e014bf","observation_id":"1c62f442-745c-491d-ba79-2870f64873ab","resolution":{"observed_at":"2026-08-15T18:40:37.815534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.413422Z","title":null,"venue":null,"work_id":"ae90c52d-ed36-41f9-8c1f-faf027d77b45","year":1974},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.820224Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:3865204348c993d6ea642e5b111bbd53383b24733a677694af9c7fe9529e0fdb","observation_id":"14bfbd0b-037f-4519-8957-b2b86a0bc537","resolution":{"observed_at":"2026-08-15T18:40:38.418175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.397480Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"44438a97-d66f-4946-8833-23b170c0db71","year":null},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.824762Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:6c5bfd651c0538d4f2b9bb7a6a52bb87c5bf9adad02780287058f05a58d3f9dd","observation_id":"72709996-23f1-405b-8e73-ab53102e910d","resolution":{"observed_at":"2026-08-15T18:40:38.402354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-14T16:28:06.194757Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-15T18:40:37.829476Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned.arXiv preprint arXiv:1905.09418, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.829476Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:86c5a1a29d1d5770c5d7f91d46fb7f1b08be9393c308ce8528d8448f576d1c8b","observation_id":"f82e7637-1a9c-4116-aec2-a4531ca909ee","resolution":{"observed_at":"2026-08-15T18:40:37.829476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-08-16T13:35:06.152621Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-15T18:40:37.834072Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks.arXiv preprint arXiv:2407.08454, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.834072Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:ed0b7a19f8fe1dcef857e0773ecaf55f7d93fb993bd64674ef13fa7af10af761","observation_id":"bb9fd9ce-bc2f-485b-8b75-5a69f0c2c50c","resolution":{"observed_at":"2026-08-15T18:40:37.834072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-15T18:40:37.838756Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.838756Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:a9df4f3ebbfaf91b94e8901f1c51860901b520b2762efbff0625d005dc542970","observation_id":"0f1c76c7-be1f-447d-97b1-3e5dd466d175","resolution":{"observed_at":"2026-08-15T18:40:37.838756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-15T18:40:37.843440Z","title":"Hallucination is inevitable: An innate limitation of large language models.arXiv preprint arXiv:2401.11817, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.843440Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:cb2a3fcc50af85b72081d7f62e3f0979a7045d77015d4964ff97d2352c5f903d","observation_id":"eb90ba01-2e48-4c1a-8361-16419156258a","resolution":{"observed_at":"2026-08-15T18:40:37.843440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.379700Z","title":"Automatic evaluation of attribution by large language models","venue":null,"work_id":"c6bddea4-7ab9-4e0a-adf5-8cbbb4f456a0","year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.848134Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:2308cad8091c22352d07a67e721386292eb233c7aaaa50d94597ce9fa6eacc31","observation_id":"910862eb-7dcf-4851-b0f2-bf858a72234b","resolution":{"observed_at":"2026-08-15T18:40:38.386382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.852758Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.852758Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:c8ba384fe9d96e4522d1cb63c6b372439c6e6e8a260953223ca6e2b0bc5f0355","observation_id":"873d4d6c-8252-4ca8-877c-455e27325931","resolution":{"observed_at":"2026-08-15T18:40:37.852758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:37.857511Z","title":"Explainability for large language models: A survey.ACM Transactions on Intelligent Systems and Technology, 15(2):1–38, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.857511Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:de9f7648a4668ccf983064446c9e5708cdd11e8b63993fe832870b9987d68d87","observation_id":"23f1c675-705d-42ce-9924-2411647b85a7","resolution":{"observed_at":"2026-08-15T18:40:37.857511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.340826Z","title":"anchorpersonalstoriestotheland","venue":null,"work_id":"282d974a-22eb-454f-9730-ee25ece7f545","year":2025},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.861863Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:4164014fa3c9fcfd8c4940cc32f41b032138c8d347ac5fe53e6cb6c533791bb8","observation_id":"fa8b4651-870d-467b-8c88-ff62a261af59","resolution":{"observed_at":"2026-08-15T18:40:38.347946Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:40:38.682474Z","title":null,"venue":null,"work_id":"108f5fb6-1fe9-421d-b831-9ca962fd279f","year":null},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.664619Z"},"links":{"citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:6631c5c2b3c4d547026e1fb3a906899124f35bfcce5f48b2eada564c43b93744","observation_id":"4c4d43da-573c-4e6e-beab-b349e67ead4d","resolution":{"observed_at":"2026-08-15T18:40:38.687534Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":40,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2506.19549."}