{"as_of":"2026-08-09T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7e2c03cfda1cfa616b50643792034955bca8ddf0e90bdc0586368195c871ea9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:13:38.329919Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.070431Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T18:31:35.391674Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2410.13846"},"observation_digest":"sha256:85d6ce7209ee3aa5f28261edade253f14948a38417bb79e6eb2b0a526bbdf375","observation_id":"76089141-4f48-4e51-8561-9c31cf68f0cb","resolution":{"observed_at":"2026-05-23T18:33:19.415000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-05-13T14:50:23.991809Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2412.06464"},"observation_digest":"sha256:7325f20eda242cd7d98a6487eb941e66e4f3f135713c514e69137be9fdba6aec","observation_id":"0082e2e0-a6fc-43d5-b057-138f82f37d4d","resolution":{"observed_at":"2026-05-13T14:50:24.320504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2502.01941","last_updated":"2026-05-12T08:04:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T02:23:06Z","title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-23T04:15:36.906263Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2502.01941"},"observation_digest":"sha256:88f27c396c85021c750ae89c3063923db6bd850ebeb60ab445b980b3f045fb56","observation_id":"e9629a70-76bc-479b-b9ba-0bfaaaeab813","resolution":{"observed_at":"2026-05-23T04:17:31.196543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-08T14:13:38.329919Z","title":"You only cache once: Decoder-decoder architectures for language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06975","last_updated":"2025-02-10T19:14:51Z","snapshot_observed_at":"2026-08-08T23:51:33.892065Z","submitted_at":"2025-02-10T19:14:51Z","title":"Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T14:13:38.329919Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2502.06975"},"observation_digest":"sha256:40578d6fbd51d1b3b5de43d78b9921c8eb3709af7200a4d0c7649f5a2e143e1c","observation_id":"7eb8ef10-7404-4e97-b97d-a9d1fd8d5eeb","resolution":{"observed_at":"2026-08-08T14:13:38.329919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-07T14:51:22.006655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17331","last_updated":"2025-06-22T03:46:11Z","snapshot_observed_at":"2026-08-07T23:55:34.286445Z","submitted_at":"2025-05-22T22:54:21Z","title":"ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:22.006655Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2505.17331"},"observation_digest":"sha256:3fdd8947ad7adcbbf92d793e45e67ce8a987919fb8c9894a76d4e980bd6587e7","observation_id":"ab040785-c0d6-42d3-94d1-0e5dd2b9d466","resolution":{"observed_at":"2026-08-07T14:51:22.006655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-06T17:20:27.714146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11273","last_updated":"2025-07-15T12:52:12Z","snapshot_observed_at":"2026-08-08T10:53:21.517764Z","submitted_at":"2025-07-15T12:52:12Z","title":"KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:20:27.714146Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2507.11273"},"observation_digest":"sha256:5b4ad565b140da69a5b6031f7dd0d31e4e2ba581795d0c00afa7a103c4cf5797","observation_id":"ca85e05f-e502-4809-b022-bace30f01456","resolution":{"observed_at":"2026-08-06T17:20:27.714146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-06T17:05:37.363103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11942","last_updated":"2025-07-16T06:16:06Z","snapshot_observed_at":"2026-08-06T16:55:31.791744Z","submitted_at":"2025-07-16T06:16:06Z","title":"DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt Compression","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:37.363103Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2507.11942"},"observation_digest":"sha256:14e974b9266b68fd7408b672372608c7e694914d6fbef673e9d0218004dd8f8d","observation_id":"a5db910f-b2cd-4b5f-be99-8f1a334ccd22","resolution":{"observed_at":"2026-08-06T17:05:37.363103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-06T17:06:34.234433Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.234433Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:55c12546ba53c1d5c004edefe0aada2bf590646a58464d72c83de8ff1e539571","observation_id":"ef02b930-ad70-4fd8-8ef7-3bc981c325c4","resolution":{"observed_at":"2026-08-06T17:06:34.234433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-06T13:57:15.771372Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.771372Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:dbdbcfaa2bcaa786b7d786b6bd053cba508971ef964d2720326d62d33894bda1","observation_id":"13304490-bca6-4a82-90c0-81c7b3e72b6d","resolution":{"observed_at":"2026-08-06T13:57:15.771372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:fb205869db85a6c5200edf5870d030a10aedbadeaf2d637be855fc8d8fc27a52","observation_id":"6e83b91d-a9ee-496d-9d4f-db0645586b0f","resolution":{"observed_at":"2026-05-13T23:49:10.824263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2605.18807","last_updated":"2026-05-29T16:33:13Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-11T22:41:03Z","title":"Block-Based Double Decoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T22:05:25.465669Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2605.18807"},"observation_digest":"sha256:14e55db9f63a416079b141ff71f4b93802c7256218a96d2889a53a628513eb15","observation_id":"a2aa1d70-5671-4611-9f6c-ec2aff9c48e9","resolution":{"observed_at":"2026-05-20T22:09:07.458682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2605.18807","last_updated":"2026-05-29T16:33:13Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-11T22:41:03Z","title":"Block-Based Double Decoders","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:10:23.224012Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2605.18807"},"observation_digest":"sha256:e4a98ef130db6b3a55e4f220fac4688b5463a475947d375a1e04d8e0aa7f365e","observation_id":"3cecfd45-a9ed-41cc-a1b3-4df3fd28b6de","resolution":{"observed_at":"2026-07-01T14:15:47.083968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-28T14:35:48.292081Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:1b5e49aaf0abfccaeda4095a3073f8792827b8bb03259040a949f7a09aa61642","observation_id":"14cd498d-80d4-44dd-8f87-f02c818b831f","resolution":{"observed_at":"2026-07-01T23:16:23.419010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-02T12:41:23.547953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T12:41:23.547953Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:d48678fcf0356b2a512e9751fbdb4ceef1a3391bb13bdedcede6c3ffeb52864e","observation_id":"4f3f47b6-d345-4f36-9191-c7a620b9f0d3","resolution":{"observed_at":"2026-08-02T12:41:23.547953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2606.06467","last_updated":"2026-06-04T17:54:04Z","snapshot_observed_at":"2026-08-08T09:09:14.963315Z","submitted_at":"2026-06-04T17:54:04Z","title":"You Only Index Once: Cross-Layer Sparse Attention with Shared Routing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T01:06:04.896501Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2606.06467"},"observation_digest":"sha256:52a6bf19f1b1e26a5ec13c23e27bc8ecea3e9dec9a4781259800e9a196d4c6f6","observation_id":"0a9fdbd2-e375-4bad-bf49-76840635598a","resolution":{"observed_at":"2026-07-02T13:46:58.824157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2606.08804","last_updated":"2026-06-07T19:49:01Z","snapshot_observed_at":"2026-08-04T14:57:16.793688Z","submitted_at":"2026-06-07T19:49:01Z","title":"Q-Delta: Beyond Key-Value Associative State Evolution","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T18:30:51.523567Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2606.08804"},"observation_digest":"sha256:af4028be5ff422816983b09d435d4befdb5a70fbd168300fc05ad3046415c229","observation_id":"57cf74bd-3e17-483f-acee-f328c61f57d7","resolution":{"observed_at":"2026-07-02T23:07:26.548538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":"2405.05254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-10T01:36:44.070431Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":"cs.CL","work_id":"527f98be-f3a0-4be5-8028-6bd13a452887","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:49bcb14b5407866caac72a16cf32f3573888e122f8bd149cf52877fad6bc238a","observation_id":"93396da0-cd30-4d86-b9da-056eb7a98255","resolution":{"observed_at":"2026-07-10T01:36:44.071688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-01T23:22:31.614891Z","title":"You only cache once: Decoder-decoder architectures for language models.arXiv preprint arXiv:2405.05254,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15456","last_updated":"2026-07-24T02:15:23Z","snapshot_observed_at":"2026-08-02T19:24:36.291795Z","submitted_at":"2026-07-16T20:58:16Z","title":"Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T23:22:31.614891Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2607.15456"},"observation_digest":"sha256:a8327fe3e7d186d0d70a402e4b1e249f2ab3a2905cb50012b1682018c3eea1d7","observation_id":"2348b8b4-20be-4ce9-ac7f-1ae1c7839e96","resolution":{"observed_at":"2026-08-01T23:22:31.614891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-02T09:51:03.340861Z","title":"arXiv preprint arXiv:2405.05254 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16252","last_updated":"2026-06-27T03:25:36Z","snapshot_observed_at":"2026-08-08T02:31:05.095460Z","submitted_at":"2026-06-27T03:25:36Z","title":"SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T09:51:03.340861Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2607.16252"},"observation_digest":"sha256:6e7f3a18e71d0f0f424fc6a617869f4bfd021c4d72d3be73ff8d809353a75565","observation_id":"72683e7f-bb28-4eb5-b906-475de5930321","resolution":{"observed_at":"2026-08-02T09:51:03.340861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-07-31T12:56:45.924478Z","title":"Jiaming Tang, Yilong Zhao, Kan Zhu, Guangxuan Xiao, Baris Kasikci, and Song Han","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28263","last_updated":"2026-07-30T14:19:11Z","snapshot_observed_at":"2026-08-08T08:40:10.642095Z","submitted_at":"2026-07-30T14:19:11Z","title":"Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T12:56:45.924478Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2607.28263"},"observation_digest":"sha256:fffc112392314c27b4700aa0e63b8f02453909fbc5d135fe4f2fc732e78cc276","observation_id":"eb06958c-9289-4e84-b333-3ac60a66a525","resolution":{"observed_at":"2026-07-31T12:56:45.924478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.05254/citation-record","integrity":"/paper/2405.05254/integrity","json":"/paper/2405.05254/citation-record.json","paper":"/paper/2405.05254"},"outbound":[],"paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2405.05254."}