{"as_of":"2026-07-23T12:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db45cdc9b63b034fde02ecf88c87ef51b9051b3143f2d24dcce6bd5754ca7469","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T06:01:40.766843Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.05971/citation-record","integrity":"/paper/2605.05971/integrity","json":"/paper/2605.05971/citation-record.json","paper":"/paper/2605.05971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.13722","last_updated":"2023-01-08T02:04:41Z","snapshot_observed_at":"2026-07-06T13:14:29.961613Z","submitted_at":"2022-05-27T02:32:26Z","title":"Can Foundation Models Help Us Achieve Perfect Secrecy?","version":2},"cited_work":{"arxiv_id":"2205.13722","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.13722","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can foundation models help us achieve perfect secrecy?","venue":null,"work_id":"238e0436-ac53-42ea-b133-ae3351988583","year":2022},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2205.13722","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:69f2540b1c3f3c78823ecc79e1dfdae5f63d460066e181eec24064c523dbe55e","observation_id":"1cbf67cf-30da-48db-9871-2b97be1dc410","resolution":{"observed_at":"2026-05-13T06:02:21.987477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:50:35.839225Z","title":"Longbench v2: Towards deeper understanding and reason- ing on realistic long-context multitasks","venue":null,"work_id":"483df3d1-b12f-4e8b-b870-b5817d5c621c","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:694dba6547b78e54e2202cb5701dee10fb3ebf4394afb3e19096a39a8f17fad0","observation_id":"aef4b139-e3c5-4177-9b93-3923e41c6c8d","resolution":{"observed_at":"2026-05-13T06:02:24.294421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-06T09:11:34.079144Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-11T03:27:46.681766Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d8b829acd51351107be11e6e52c870772c9233db5860a765a0e23d2eda988443","observation_id":"b4d5c7da-b73d-4ec3-a51a-c821f65cb593","resolution":{"observed_at":"2026-05-13T06:02:21.990094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6239","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:17:24.877495Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"d1a9f293-b596-42e3-b48c-112b9f9a06df","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d1e894da9b8bf8721353b17823813660916320ad2ffbeda045d75eb889dd4f43","observation_id":"3493bf0e-5511-4291-a28e-3e97eaa32b7a","resolution":{"observed_at":"2026-05-13T06:02:21.793734Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-12T15:19:26.714626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T15:19:26.714626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"30f4b8bd-64e2-495f-a9fe-7fe29b29268a","year":2022},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:af7dfeebc8028c5ea0293b6da947c30abe95d541f9b326d7bf7a4623cb32fdd1","observation_id":"7be11d93-61c2-4889-b04b-0795f160ba40","resolution":{"observed_at":"2026-05-13T06:02:24.289944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PyramidKV: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":"08e56bd8-cbce-4c58-aa8d-59d476dce670","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:e5557e1f1886a56272fe93fbfb417c923c1e5898dacdd053a14c0b6fdba799af","observation_id":"9936c8c6-164c-45d0-93f7-f81526078cb2","resolution":{"observed_at":"2026-05-13T06:02:24.287922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15902","doi":"10.48550/arxiv.2602.15902","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Doc-to-lora: Learning to instantly internalize contexts","venue":null,"work_id":"68246c40-3863-455d-82ed-03dea2aad784","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3d4369da0819184263a9175241027b9f2efcc86378899acf25fca38dac0cb027","observation_id":"66d1b34d-c5f2-42f7-8b5e-bc7920e8e19c","resolution":{"observed_at":"2026-05-13T06:02:21.959138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":"2503.09567","doi":"10.48550/arxiv.2503.09567","metadata_source":"pith","pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-07-10T18:57:31.639044Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","venue":"cs.AI","work_id":"0b361fed-cf2a-4b90-b61a-de88de4b8840","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d08356f95ee17c221147df3d3bbc69856898a7128d4b7a8c9b1b16cf9e494c08","observation_id":"a658111a-bcc5-49ea-9152-d1f6504481de","resolution":{"observed_at":"2026-05-13T06:02:21.981495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:19.477611+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05877","last_updated":"2024-11-08T00:42:47Z","snapshot_observed_at":"2026-07-06T19:47:38.708013Z","submitted_at":"2024-11-08T00:42:47Z","title":"Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward Pass","version":1},"cited_work":{"arxiv_id":"2411.05877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.05877","snapshot_observed_at":"2026-06-29T21:43:59.523418Z","title":"Generative adapter: Contextualizing language models in parameters with a single forward pass","venue":null,"work_id":"77c99007-545a-437f-af6d-54d1852f4f16","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2411.05877","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:36910d785314b22c51eb1137d9aaa4808beca7c5e77ef06f2a1a1ca2343cfb62","observation_id":"1eba9c7d-de47-40c9-8bcf-90e758f08cbd","resolution":{"observed_at":"2026-05-13T06:02:21.953195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adapting language models to compress contexts","venue":null,"work_id":"d40dd826-89eb-49f2-b3e1-c2ac00577674","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5868e2e71d3d143ce1529264c568d7b57725a3c0a4bd59f07b4daa99917e6d2d","observation_id":"3c77b851-8b43-40e8-9fbd-2e4dda0c619b","resolution":{"observed_at":"2026-05-13T06:02:24.285790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-07-06T10:00:17.079229Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":"2009.14794","doi":"10.48550/arxiv.2009.14794","metadata_source":"pith","pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-07-11T01:47:47.727352Z","title":"Rethinking Attention with Performers","venue":"cs.LG","work_id":"4c26d308-8b72-4a98-8e73-950617a75f50","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:764966e2c0e0cf9c72f13c2dea632dbe4095bbbf7984d9b2fcb8361df59cde8e","observation_id":"d9c843de-99c1-4fab-9c12-28c8a18157f2","resolution":{"observed_at":"2026-05-13T06:02:21.943990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:458787aee1f0c7d01df97d6201244027e349501e0a522b2b27d39087e6ec3d15","observation_id":"4db62a8c-2dd1-455a-a48d-c04e2aa53630","resolution":{"observed_at":"2026-05-13T06:02:21.967996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n18-2097","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:38:43.144167Z","title":"InProceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 2 (Short Papers)","venue":null,"work_id":"3f953153-3adc-4d0a-991e-da2233c3fdef","year":2097},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5de746abdd7f711f04c7100752e34ce45328d3471eaaeec7dcccc8e81b36161d","observation_id":"f93f265d-ef37-4145-ac87-3a3901e4034c","resolution":{"observed_at":"2026-05-13T06:02:21.797274Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:29:08.271003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:29:08.271003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:53:58.730509Z","title":"Approximation by superpositions of a sigmoidal function.Mathematics of control, signals and systems, 2(4):303–314","venue":null,"work_id":"131a9bf6-1720-4d86-ad85-ce6df6567aba","year":1989},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:2d3c9859216e76f2ac0dde5ca592c22666ec338d093928e8df367cc496f67737","observation_id":"f84f24d0-bfe3-49f4-9a63-c1def112e4f3","resolution":{"observed_at":"2026-05-13T06:02:24.278883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14382","last_updated":"2021-10-27T12:31:43Z","snapshot_observed_at":"2026-07-06T12:02:36.241266Z","submitted_at":"2021-10-27T12:31:43Z","title":"The centered convex body whose marginals have the heaviest tails","version":1},"cited_work":{"arxiv_id":"2110.14382","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.14382","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The centered convex body whose marginals have the heaviest tails","venue":null,"work_id":"e82b00e0-bca9-4552-9215-23a8ed881368","year":2021},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2110.14382","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3e3391be224861ef07d78641953bd148d0ef524edc60babdf8789aa1aef5493b","observation_id":"dae1ed25-d9e0-412f-9bfd-c30c20856816","resolution":{"observed_at":"2026-05-13T06:02:21.946969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","venue":null,"work_id":"3c4fe23f-3b1a-488e-99ee-302a75dab4af","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d8ae2fc666584a0edcae458322c360088178a4bfd899f0705161e285f53b28ba","observation_id":"9e953d73-6031-42fc-9a30-726e1da7f055","resolution":{"observed_at":"2026-05-13T06:02:24.283639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-10T20:07:33.480124Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:9fe8369b47c0e6072ec2a616ae1edf1147130510d89e8d8813e41c919ac468f7","observation_id":"b5a6d708-345a-4c78-bccf-c14a19e9d834","resolution":{"observed_at":"2026-05-13T06:02:21.997183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":"2111.00396","doi":"10.48550/arxiv.2111.00396","metadata_source":"pith","pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","venue":"cs.LG","work_id":"4150b761-b8bf-4d9b-a2f8-cb2d1b73d378","year":2021},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3b29c06eb96ab895670fa63608eaf2aa0bd5863edbc20b899619568b3fb477d5","observation_id":"fa307a39-d96e-414a-895a-048eb46a3527","resolution":{"observed_at":"2026-05-13T06:02:21.984721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lighte- val: A lightweight framework for llm evaluation","venue":null,"work_id":"2be77100-2b9b-4936-ade3-ef8430017fa2","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:99d35d9d6734599e668002b6f0538d2048fda163b5e0960423c92b6c9d97ea29","observation_id":"af3ae607-84bb-4fd7-bb85-7ca3fc615b42","resolution":{"observed_at":"2026-05-13T06:02:24.281046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delta-net: Real-time network verification using atoms","venue":null,"work_id":"a7cea1f8-8367-4322-bf8a-0a67dbcf255a","year":2017},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:decf1871f8eb7372d2ffc86ff8c90ca03e98b2ee47f0e3e5f977e57842d88b31","observation_id":"90d9039f-cf5f-484a-8221-1c221834db3b","resolution":{"observed_at":"2026-05-13T06:02:24.296958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:03.230004Z","title":"Approximation capabilities of multilayer feedforward networks.Neural networks, 4(2):251–257","venue":null,"work_id":"7b11e809-4640-4c32-962b-4a7e7ad57f9e","year":1991},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:4330a83dc4ef9257dac370ecab5d0ed9d229b16ad83c637dfe443429a0c31825","observation_id":"7eec02fd-e121-411b-a8aa-89dbac8dd5cb","resolution":{"observed_at":"2026-05-13T06:02:24.274052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07955","last_updated":"2025-07-15T09:06:11Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:39:37Z","title":"Dynamic Chunking for End-to-End Hierarchical Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2507.07955","doi":"10.48550/arxiv.2507.07955","metadata_source":"pith","pith_arxiv_id":"2507.07955","snapshot_observed_at":"2026-07-11T03:47:48.585529Z","title":"Hwang, B","venue":"cs.LG","work_id":"2c24205d-e043-4482-800c-bb7d2d61ad6c","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2507.07955","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:e16bb053db2c117f1e038c2f23d9ea58c9769de0912e70d3f052f65ec6482fe4","observation_id":"68a00469-4c6f-486a-9f23-033449813713","resolution":{"observed_at":"2026-05-13T06:02:21.965287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":"2311.11944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-07-04T20:40:08.190653Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","venue":"cs.CL","work_id":"b60d115e-50dd-42f6-9178-5d29b05e1e89","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:c9ee9057de1cadf2128d59b9557ef4e4088f152fa20394a2ee0464f05b9a2937","observation_id":"9a326a7c-54ae-4f48-bf4c-838d0e8a0510","resolution":{"observed_at":"2026-05-16T05:01:13.018607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLMLingua: Com- pressing prompts for accelerated inference of large language models","venue":null,"work_id":"737fea9f-041b-4c95-a5e2-36b9eb5db579","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:0b3f20b383fc5f8e917d74758090ada01f6ba466a76fa7a1cdf21285e968dac4","observation_id":"452ddc86-650e-4627-9d2e-738e064716b8","resolution":{"observed_at":"2026-05-13T06:02:24.271575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LongLLMLingua: Accelerating and enhancing llms in long context scenarios via prompt compression","venue":null,"work_id":"6dd7f39e-3394-45c3-9a4a-7ecbc1a6e765","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:1d8a028ab8968118de22c533cbe60435145c44e050e0b9a285f32f252e2f844c","observation_id":"147a14f9-4813-44e6-8fc8-36fa5f80ccbd","resolution":{"observed_at":"2026-05-13T06:02:24.276579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal experimental designs.The Annals of Mathemat- ical Statistics, 37(4):783–815","venue":null,"work_id":"0e98e9a6-661d-4856-98d4-8b7a3e7eccab","year":1966},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:9e89610568ed995588d46253032f24ce4688811a4fb27e18ad73fb435970582a","observation_id":"7b6c23f3-f5ff-4d25-a284-f34b0ee6cc09","resolution":{"observed_at":"2026-05-13T06:02:24.269453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tchebycheff systems: With applications in analysis and statistics.(No Title)","venue":null,"work_id":"5fe9cf05-4db3-4abe-8ccf-0482fbd63bf0","year":1966},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:75dc3c0fe9861ff879a3e1d4da675fc1e55b4ddbac35cf8c1261aec0d6643a87","observation_id":"7677d385-0243-47cc-85d4-c0dc0da6fdd1","resolution":{"observed_at":"2026-05-13T06:02:24.264839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chebyshevian spline functions.Siam Journal on Numerical Analysis, 3(3):514–543","venue":null,"work_id":"e49f2902-a4f4-4389-b980-23ace845412c","year":1966},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:2af78f09c46c020132d5db0b6358466011387cc699c477be25da73d19169d82a","observation_id":"14256ac9-4194-45c5-81a1-37e532fa0702","resolution":{"observed_at":"2026-05-13T06:02:24.267004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/itsc55140.2022.9922275","metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:35:02.874741Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":"2022 IEEE 25th International Conference on Intelligent Transportation Systems (ITSC)","work_id":"538e32a7-33de-461c-9bcc-7d531a31fb65","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:e365a7fc1e1938fd2d60c79d7211a1618430c20102a0286587ed517e861ec39c","observation_id":"dc366d46-17fc-4c89-9a35-3a056296534a","resolution":{"observed_at":"2026-05-13T06:02:24.260987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23416","doi":"10.48550/arxiv.2505.23416","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kvzip: Query-agnostic kv cache compression with context reconstruction","venue":null,"work_id":"5f731372-7406-4bf9-9ea7-10b18aad3813","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d2ab022005a3f4f60977eedd7bab8bc0ab5b9dce79d9b7e115b0ceb8223a0c0e","observation_id":"265f9aee-8bae-4477-8744-baafd32ad3aa","resolution":{"observed_at":"2026-05-13T06:02:21.971227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lexico: Extreme KV cache compression via sparse coding over universal dictionaries","venue":null,"work_id":"afacd0d7-943a-41ba-84cd-5eff5a7d534d","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:80cea6a6a834f70d29a8d7e1ee195cbea622057ae9c01ba3d80642bcceaa496b","observation_id":"0c3ab234-0bc3-47c1-a830-35e95aba6680","resolution":{"observed_at":"2026-05-13T06:02:24.254451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-augmented generation for knowledge-intensive NLP tasks","venue":null,"work_id":"72db7074-caf5-495c-98f2-d3b4aa497c9e","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:ee0bd0976cdf5ae834371e917763576cb27cf156bb43665cac645dd324048fe0","observation_id":"d9c0c9a0-9b89-4abd-a86b-dc07dc7fb28c","resolution":{"observed_at":"2026-05-13T06:02:24.256522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compressing context to enhance inference efficiency of large language models","venue":null,"work_id":"1155db43-334c-4c01-9ed2-5a7f36dad6ab","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:a8a4432cf0a11f7c5c376faccbf91b1b7d30ab20e617d260291eb956f8c0ab8e","observation_id":"b36181d0-9a4f-491d-9dbb-4544c41064c2","resolution":{"observed_at":"2026-05-13T06:02:24.258780Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapKV: Llm knows what you are looking for before generation","venue":null,"work_id":"278db99e-52fd-4d28-a132-2f993d827801","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:fd0a11edf5102542d0f022b36e4fa1bd470d9bba220678de6c5b02aa26ff045e","observation_id":"0d344f97-1b95-470f-8156-b066ee485948","resolution":{"observed_at":"2026-05-13T06:02:24.262982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17424","last_updated":"2025-02-05T14:06:21Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:32Z","title":"LARM: Large Auto-Regressive Model for Long-Horizon Embodied Intelligence","version":2},"cited_work":{"arxiv_id":"2405.17424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17424","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Larm: Large auto-regressive model for long-horizon embodied intelligence","venue":null,"work_id":"f6aca9a0-2ac1-469c-bba4-fa0c53c16c7b","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2405.17424","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:97b07df6e055f9fa301abbacb610d49539eef2a3ac967ba76c7ed488e9812b04","observation_id":"ced269bf-c1b2-4443-959a-8fa0189b7ab3","resolution":{"observed_at":"2026-05-13T06:02:21.993912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06358","last_updated":"2026-07-04T16:06:38Z","snapshot_observed_at":"2026-07-09T23:17:12.777143Z","submitted_at":"2026-02-06T03:40:31Z","title":"SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass","version":3},"cited_work":{"arxiv_id":"2602.06358","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.06358","snapshot_observed_at":"2026-07-03T16:18:37.220368Z","title":"Shine: A scalable in-context hypernetwork for mapping context to lora in a single pass","venue":"cs.CL","work_id":"506a565a-320f-444d-8a9f-11a065048931","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2602.06358","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:facb9620b18317f1046a61d6782a3115b5dd23fea6f2d4a0781fe329965c652d","observation_id":"89401e05-302f-4574-9d6f-221366601686","resolution":{"observed_at":"2026-05-21T03:03:41.308564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:45:59.128873Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"e24e2207-094f-4683-b902-901f466712ba","year":2016},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:860a45d702eaa7c3ed6b2a6479f3ecd42da66c72ab9a0dbb6b8c7041681e8344","observation_id":"628d164d-0462-476f-9b91-c95e952b6feb","resolution":{"observed_at":"2026-05-13T06:02:24.292079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d2e36215-c3e7-4699-91ae-025936f9450e","year":1977},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:6ebba7c01f7d4e76506ced9d75a452d97ae2319c0689e8aa8b7c65a22a9516b1","observation_id":"8976502a-1931-45cc-a261-2796fd872c02","resolution":{"observed_at":"2026-05-13T06:02:24.250037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1260","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.398004Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"642f5867-b098-4ec2-9fd0-c6dd37388412","year":2018},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:a4cbf36856f239b32ab7350a1d1497b4ce3e1da229c35ad9a7525961ddf45625","observation_id":"bd3951d8-cdd7-41c6-9b01-43f233d1d814","resolution":{"observed_at":"2026-05-13T06:02:21.790714Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-17T19:51:13.783624+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T19:51:13.783624+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to compress prompts with gist tokens","venue":null,"work_id":"9cb1d057-1877-49c8-9a1f-8b067fb26859","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:7bcd3d58510c301be9d8b5b71fd34164d14eedfe2f32ff6d37e0062acc690bc2","observation_id":"e313e9fa-7d48-4e25-b6fe-6b3a50bef301","resolution":{"observed_at":"2026-05-13T06:02:24.235100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:02:30.959252Z","title":"Using an llm to help with code understanding","venue":null,"work_id":"4b0794f1-1617-4c67-9224-a9b223f81303","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:6e41762431198a4aeea30d6eefb744f7a3e63a1d4d661641a239e030b44cd54a","observation_id":"e5718b8d-1ccb-478e-8d9b-d9a69704d022","resolution":{"observed_at":"2026-05-13T06:02:24.220818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context Engineering - Short-Term Memory Management with Sessions from OpenAI Agents SDK, September 2025","venue":null,"work_id":"74e41404-c5a8-4a09-9c4d-0ca9064e5354","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:f7856fbc80308ea4d89886d5111bd1b54055f9485ca890a1ef885ab65bea3db5","observation_id":"c076a8b2-29b6-4f6a-a674-b13ac4d9bd53","resolution":{"observed_at":"2026-05-13T06:02:24.223236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1043","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:02:45.926587Z","title":"Transformers are multi-state RNNs","venue":null,"work_id":"bcf46bab-4869-4065-8d61-02079a78bde8","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3743d5776fe38084394a3ed1ba0cde18475b54c9e077fa95c9e2b17fe5092087","observation_id":"436b9803-9b50-47e7-8d5a-f49bbe585cbc","resolution":{"observed_at":"2026-05-13T06:02:21.803106Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:49:10.771953+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:49:10.771953+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale.Advances in Neural Information Processing Systems, 37:30811–30849","venue":null,"work_id":"ac491598-4499-4e49-bc34-d6775b7688d2","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:276ef7be8e3f69cbeb309959b30aa0059ddfd8c8cc6483e3a0892d2fcff27be5","observation_id":"393bdcbc-4be4-4d49-99d4-95bf24436637","resolution":{"observed_at":"2026-05-13T06:02:24.227937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-07-10T20:07:33.494399Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:c1495776f21103b8f6eb9b91c7461d5fe15947c56c0432570fc6a851c45b5d92","observation_id":"4c76dc23-6216-4dfa-b833-1a6b6a2f153f","resolution":{"observed_at":"2026-05-18T10:46:17.004740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective context engi- neering for ai agents, September 2025","venue":null,"work_id":"26b66a0f-9f69-4372-90ea-f99262b5d022","year":2025},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d514f79cbe44798e574fc69781b4a0ede876107dc2bffe0ebf2cbc89e4cdb3b0","observation_id":"40abb738-a348-46b4-aa94-045157a1adbb","resolution":{"observed_at":"2026-05-13T06:02:24.218665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6399","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:30:37.808511Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":"a80a62e7-1fb6-4805-a09c-3447c2c1145b","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:a294b987e5f33181993bdfde9a1f3c7768a289270b6b1d7b59ed3f0d38e6ba63","observation_id":"59cfac00-a8e9-4f9b-a166-4993e0673cf3","resolution":{"observed_at":"2026-05-13T06:02:21.786005Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:52:35.422292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:52:35.422292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representational strengths and limitations of transformers.Advances in Neural Information Processing Systems, 36:36677–36707","venue":null,"work_id":"44e6d702-139b-4baf-b0c2-8c9db4c8fbdd","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:f904c73f17511400f6c0b29c71f5264ee681ae373f6939d0882b4a12891264eb","observation_id":"1d3aa75c-7184-4ffb-8779-6622470094bd","resolution":{"observed_at":"2026-05-13T06:02:24.213905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":"bd729514-55dc-47bb-bc44-358cb315b444","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:e84773cfbf686082fa22f188ccde371e39ea79c94406c141f45d78b4d323cc8f","observation_id":"fe83771e-4d4a-471c-89e7-526400e0d2da","resolution":{"observed_at":"2026-05-13T06:02:24.225530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-1454","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:06:58.245746Z","title":"Social IQ a: Commonsense reasoning about social interactions","venue":null,"work_id":"67b76bf2-8e96-4f03-93f2-2b52627b4baf","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:ee5152a38927d3f5a09c112c5cd60a9a4313ae68bcd0fc3c9b0240b2d07cf590","observation_id":"3f357129-8531-4ade-8248-1d2c178f607b","resolution":{"observed_at":"2026-05-13T06:02:21.800181Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:52:34.950821+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:52:34.950821+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QUEST: Query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":"5118dc17-8556-4370-a334-e52b6dbbfc6b","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:d7e48701f34d08e6d85fbdb569cd0c2ba8fb62af77f1899d49b5860c955ffe64","observation_id":"ce7ad80b-0f42-46bf-8ae6-71a8d92048bd","resolution":{"observed_at":"2026-05-13T06:02:24.252230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:53.870959Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":"69d50b7a-8945-41ea-b24b-3dec8e57f9fe","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:f759c4bbf78c7a0a7cf55f0eed6c74c42fb19b8cc3bbcd0acc50ff2d74594b4a","observation_id":"3080a2c0-cb92-4ffd-81ed-a3fcae3bda5f","resolution":{"observed_at":"2026-05-13T06:02:24.204011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:12:44.865658Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"a411ef93-f6ba-49cb-a261-09f4a3b6041a","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:cf8160f7ccc50e7ec5c5a05508763b55ab91d9e506fdad4263a6cd2ad5b599a5","observation_id":"8a2a4e3b-5597-493d-bd83-ac4725c3f36a","resolution":{"observed_at":"2026-05-13T06:02:24.208978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":"2410.10819","doi":"10.48550/arxiv.2410.10819","metadata_source":"pith","pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","venue":"cs.CL","work_id":"dcb5f5ed-ec94-4386-bfa7-02fcaeb844f1","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5136036e19d94527b263a2d22a48763793eef199dd86779a659f9ec85e73a433","observation_id":"0bd4eb5c-44b2-47f3-b70f-859d0874db08","resolution":{"observed_at":"2026-05-18T11:49:16.947404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-07-06T20:03:51.758274Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":"2412.06464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-07-10T21:57:39.161066Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","venue":"cs.CL","work_id":"884939d3-e283-4625-bff4-b7e0e4cc2a6e","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:61a9b4f02a71d1943de656dbab9164454619d612b533e3fbc6f839b50fbaa1f9","observation_id":"6113bfcc-ac39-448c-a9d4-21b8a1d1bba4","resolution":{"observed_at":"2026-05-13T14:50:25.025022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.15160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.15160 , year =","venue":null,"work_id":"35ef8ad8-49ca-40f4-8dc7-0cad75bea537","year":2024},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5559d1f05446715358a0cab6baa0783533c74a8c10ea3b96f9ca9bd994f853f4","observation_id":"dc536cf1-3d8d-4043-b146-f4033d7e12e7","resolution":{"observed_at":"2026-05-13T06:02:22.000080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep sets.Advances in neural information processing systems, 30","venue":null,"work_id":"8d0304cf-6351-445b-851d-20c1660e8fd1","year":2017},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:46a26681d0a43756371ee9ccce91bfd5b1d468b6a98865f8bc9a509ea01fb24b","observation_id":"2bb92f07-362e-4e28-b0da-f1f7bf28eabe","resolution":{"observed_at":"2026-05-13T06:02:24.237288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big bird: Transformers for longer sequences.Advances in neural information processing systems, 33: 17283–17297","venue":null,"work_id":"a09b5178-cc0b-4779-9512-72f8adccd8b9","year":2020},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:92385998d7269172aba6fc5f0e3c3f6471ee2e774606388a9d2c3545e360b3a6","observation_id":"5cffa41d-2c43-4d58-931e-df3ed14a0102","resolution":{"observed_at":"2026-05-13T06:02:24.230077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1472","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.406813Z","title":"URL https:// doi.org/10.18653/v1/p19-1472","venue":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","work_id":"11bfc949-547c-40f3-a86d-953eb9b2154c","year":2019},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:24d3956250c475394d5633472fe37c7d2fe99d5e713145c212360ad7d9b8f4c4","observation_id":"6557247c-93a1-4764-9f98-24dfbadeb32a","resolution":{"observed_at":"2026-05-13T06:02:21.806038Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-12T15:19:27.171453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T15:19:27.171453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"f0b187d3-058f-49da-8b6e-9711db28c85b","year":2023},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:5927ea1b24ef5c365893dc5372979a29be3c2585bce27ea7e1e7523d94fa8d4a","observation_id":"78c43fa5-9a10-49a3-84fc-d3d4cf794a20","resolution":{"observed_at":"2026-05-13T06:02:24.216232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong learning of large language model based agents: A roadmap.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"f0b706d2-f5fa-42a5-b836-817e328b59a2","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:1e937fe492b0d28e117a379b70eeb1b2d6438a084d6ed525bec6db82bb04bef4","observation_id":"7444f49f-cb4e-4adb-83e3-5f870f1a0af6","resolution":{"observed_at":"2026-05-13T06:02:24.232644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast kv compaction via attention matching","venue":null,"work_id":"ddd7a574-ce5b-41ed-bf23-42ea0d08f3d1","year":2026},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:803dffe87dc89db3815671de7408a32fae59950fbe1b0039da80b9831dda56e2","observation_id":"7b4e5337-878f-4ec0-a002-6601849bdb1c","resolution":{"observed_at":"2026-05-13T06:02:24.244984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"an)∈A n withn≤N, ∥f(a)−M(a)∥< ε.(70)","venue":null,"work_id":"4314ea11-21ed-4464-8573-6dddeee30a86","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:f2b6753ecbaf7bd9d06d4e3ce6e7f58bedbaf6f4687f4e08bdd2edbcb9a170a8","observation_id":"c6758ec7-0854-4dcb-8ee1-936b6165bf6a","resolution":{"observed_at":"2026-05-13T06:02:24.247803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8dba43c9-2d82-444e-83c7-1f3998204378","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:6eeb7c0830f2e031f7f3d6fb135d4dcea9d6bf8f27a82f5847ee646f7e4109b8","observation_id":"65356efd-af18-492c-b640-be94d32de4c7","resolution":{"observed_at":"2026-05-13T06:02:24.206400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"an)∈A n withn≤N, ∥f(a)−M(a)∥< ε.(97)","venue":null,"work_id":"768a3bf4-e65c-42fb-8d6c-f23485aba821","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:3394bb77508214c1df398657d80c2ebbb41e84715263eeb6281fc23ad279dc6c","observation_id":"7ac604d7-f5e5-41b1-a5f0-4b3f2221255f","resolution":{"observed_at":"2026-05-13T06:02:24.211502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7800.4610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"By the same argument as in the proof of Lemma A.7, there exist functions ϕ:R d0 →R d1 andρ:R d1 →R dout such that for everya= (a 1","venue":null,"work_id":"365cf4cb-7eac-4e6e-8bac-604973b30589","year":null},"citing_paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:40.766843Z"},"links":{"citing_paper":"/paper/2605.05971"},"observation_digest":"sha256:c1dc425df7cf41ff36479111e5182640ac68d9a1c839450c8730beabf12b0d11","observation_id":"a0c110ff-ee9b-45a9-8cad-83a1c8769821","resolution":{"observed_at":"2026-05-13T06:02:21.950355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05971","last_updated":"2026-05-12T06:42:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:17:55Z","title":"Training Transformers for KV Cache Compressibility"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":23,"verified_fuzzy":38},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2605.05971."}