{"as_of":"2026-08-21T10:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:990ba3b3a659f31be01108096232b19cf38fa8dc4a7cbe7e9be4173167280c4e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:05:31.666299Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13541/citation-record","integrity":"/paper/2506.13541/integrity","json":"/paper/2506.13541/citation-record.json","paper":"/paper/2506.13541"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.401884Z","title":null,"venue":null,"work_id":"b57a3d81-4d35-479d-bd4f-5d2e031a5adc","year":null},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.389603Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:cd587466ff0cc195a9e8b15a68fed0e1c38efb8b6597da70e8e3aeac162f458a","observation_id":"22f9d0dc-9499-4f3b-8efa-16a0c2e7b8e0","resolution":{"observed_at":"2026-08-15T20:05:32.406361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T20:05:31.400222Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.400222Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:6e89d2534c2ee0f13afc7b82a8b13076b01a0d191441be293ee5be1887c058d7","observation_id":"51a6473d-afb6-4da2-95c3-131801ff3b53","resolution":{"observed_at":"2026-08-15T20:05:31.400222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.372451Z","title":null,"venue":null,"work_id":"1cf999ee-65d6-4c51-a0a5-3769df488baf","year":2020},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.405830Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:b48b1de6b92e0f6e46211405d7b365e8457ab7565aaa828204648dedd7a77d79","observation_id":"d91d82ac-7818-4992-b933-55c0dc9b1ffd","resolution":{"observed_at":"2026-08-15T20:05:32.376983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.357646Z","title":null,"venue":null,"work_id":"2b2d3f7a-a5fa-4778-91d8-a7e6e9daf02e","year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.410779Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:bf4cdd9ec3ff3911956a5b4d002bb009bb53730050b23dc90956e325b038c883","observation_id":"cd7bd16f-5103-42fd-baaa-cab7941d09b6","resolution":{"observed_at":"2026-08-15T20:05:32.362435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-15T20:05:31.415718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.415718Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:d3caaaf627dc0fc5f9f76f12275735addf3b5be5f6bf577960310cf65a5002e8","observation_id":"bdf77aca-09a1-4768-ae1e-daa1802263e9","resolution":{"observed_at":"2026-08-15T20:05:31.415718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.342779Z","title":null,"venue":null,"work_id":"ca064781-80b5-4c86-a58d-800f223e5426","year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.420380Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:daeb2ef4cfa56643f7fed6f91548968354589a9cab1d54a4597b3dfb437795d4","observation_id":"cf5a0001-ffb0-47ae-b213-1d79213cb1fe","resolution":{"observed_at":"2026-08-15T20:05:32.347369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03675","last_updated":"2024-08-08T01:20:13Z","snapshot_observed_at":"2026-08-16T13:28:00.366504Z","submitted_at":"2024-08-07T10:31:07Z","title":"NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03675","snapshot_observed_at":"2026-08-15T20:05:31.425235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.425235Z"},"links":{"cited_paper":"/paper/2408.03675","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:e0808863122b8dcc97b3482fed7dcacf0aae0de6faa6f04b8ad792edd135776c","observation_id":"0ed633b5-ec1c-47b7-ade8-48dd1705c6a1","resolution":{"observed_at":"2026-08-15T20:05:31.425235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:31.430123Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.430123Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:fd4dc5ee03def6bae72cb34924c24d6be5b368b8e47e4e64791514bf1af59251","observation_id":"150a552e-d1fc-4f64-8f2a-9c93ed0a6d1e","resolution":{"observed_at":"2026-08-15T20:05:31.430123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:31.434417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.434417Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:a8358236994654b85a08f7aa526b46903c133aad627d8c511cacd5a36f9398fd","observation_id":"82c7a29f-049f-41be-9c3b-c110fb6e91fc","resolution":{"observed_at":"2026-08-15T20:05:31.434417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:31.444179Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.444179Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:6212722eb8c6270e09976d9b7777fa985f6e1748fae1865cdc3df403faf84f1f","observation_id":"44572637-25ee-487b-8b32-08989ed7efe2","resolution":{"observed_at":"2026-08-15T20:05:31.444179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T20:05:31.448883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.448883Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:4d49fd252a337def4e50e911cbcf18c1c9a84936ed85548d1d332e3277206f02","observation_id":"a73011eb-b8f9-4d94-960e-3ead869ca6ad","resolution":{"observed_at":"2026-08-15T20:05:31.448883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-14T22:45:56.335948Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-15T20:05:31.453688Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.453688Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:e662a47e2cf0a316b733b18a9826bc57095023134a54c5970478235972afda0e","observation_id":"4a6ac0df-9bd7-4d57-91dc-e205682368b8","resolution":{"observed_at":"2026-08-15T20:05:31.453688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.299227Z","title":null,"venue":null,"work_id":"a4016918-cd22-4624-b506-96458d7d7770","year":2021},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.458349Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:f7dff0f58e6fc1984ddf03b556052a253bb84c24b2ff99aca9e11e48f6f471d5","observation_id":"2cf343f9-4542-421f-8e20-31ea1be5f8e5","resolution":{"observed_at":"2026-08-15T20:05:32.303601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-20T18:20:17.447831Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-15T20:05:31.462841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.462841Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:523c6fab71cb8511e907ffdff8a609087bfa63cb5915f1bda6a44d364689af69","observation_id":"e4634f3f-0f32-482c-8cf6-63d5bdc4ec8e","resolution":{"observed_at":"2026-08-15T20:05:31.462841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-21T05:15:28.840279Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-15T20:05:31.467522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.467522Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:863b448c0ec9486aebbb8d3a8ec6070892ec8cf135d87bc4f1e1b91cfb9bb82f","observation_id":"80d41f08-a09f-44f3-9db3-4918deb6341c","resolution":{"observed_at":"2026-08-15T20:05:31.467522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.284868Z","title":null,"venue":null,"work_id":"a47b7ee0-473b-4457-90c3-e7b45fb92403","year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.471861Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:e684d3db31681ba116626c22f33543354b2d1ec1f559bb6738ec69abb5d6b051","observation_id":"0a90bd23-98e7-459b-b2ba-b7c48535462f","resolution":{"observed_at":"2026-08-15T20:05:32.289155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.01852","last_updated":"2015-02-06T10:44:00Z","snapshot_observed_at":"2026-08-14T23:01:07.044616Z","submitted_at":"2015-02-06T10:44:00Z","title":"Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.01852","snapshot_observed_at":"2026-08-15T20:05:31.486387Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.486387Z"},"links":{"cited_paper":"/paper/1502.01852","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:9bed579f4d6300a7113b0c5b115493e58aaff112b7d12b7f8d7be3b8628e26da","observation_id":"fb3442b2-0481-4b03-9702-9f9087e05872","resolution":{"observed_at":"2026-08-15T20:05:31.486387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.270399Z","title":null,"venue":null,"work_id":"ab8d22e7-fc1d-44c4-9027-2817775b5a44","year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.503522Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:2f6b6286816b6271c0ed2d448152715c199c7e001f76bbcf31d41ce29c0b7ebf","observation_id":"29b58917-0b34-4786-8ad4-431c417058ad","resolution":{"observed_at":"2026-08-15T20:05:32.275015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08442","last_updated":"2023-04-17T17:03:56Z","snapshot_observed_at":"2026-08-16T15:39:49.500140Z","submitted_at":"2023-04-17T17:03:56Z","title":"The MiniPile Challenge for Data-Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08442","snapshot_observed_at":"2026-08-15T20:05:31.523559Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.523559Z"},"links":{"cited_paper":"/paper/2304.08442","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:c3b85615ba2f5f0e8f54d1b272ab7951cb13f6cb992ae7028eb0ea0e34982e05","observation_id":"cb408aae-dfcc-4d72-9729-0dd3e9cd5654","resolution":{"observed_at":"2026-08-15T20:05:31.523559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.254930Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":"f28dfae3-47e9-43bf-a457-5b8a7367377d","year":null},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.547652Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:b2a20f07e0061cde36fbb75b91f2cfd4d4a7bfe9e1d76d5c723529be8c7f84b4","observation_id":"eed1e0af-bbe6-448d-9db7-f1c625cb4521","resolution":{"observed_at":"2026-08-15T20:05:32.260395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.241243Z","title":null,"venue":null,"work_id":"bac56bbf-7b41-4a31-8dd5-beaab4509386","year":2020},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.572041Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:1e50bd240d5f221c868eeef55354bf1f4e7c73bce19a83820a9bc235f4a31914","observation_id":"b1400d55-4512-4349-8948-dd617294612b","resolution":{"observed_at":"2026-08-15T20:05:32.245152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-15T20:05:31.576902Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.576902Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:b48657a00ff603a81aa832b841c3dd718522b20551fa549553c64087e0fea715","observation_id":"5db373b7-46cb-47fe-9d69-c23bf24a6fd4","resolution":{"observed_at":"2026-08-15T20:05:31.576902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.228155Z","title":null,"venue":null,"work_id":"1df42dd9-2d5a-47f4-ac57-fbc777c68cb0","year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.581358Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:f038517ce89edf6fd12d065c426ba84861123578975f1d27b71bd3d15d9749a1","observation_id":"f690f2fb-ea4c-4de8-b653-1ad4155e817f","resolution":{"observed_at":"2026-08-15T20:05:32.232098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-15T20:05:31.585947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.585947Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:195f33cd698809e05d68ad8a4e4a73bac329e68950a00e0ec49cc26bd70118c1","observation_id":"9b61bbfa-df50-464b-ab05-28d1066cfc9c","resolution":{"observed_at":"2026-08-15T20:05:31.585947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-15T20:05:31.590710Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.590710Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:65323a50e74f03ec79ecf3c8ac3ef26503d1b28b9a36eaaf327ff346a12c8d00","observation_id":"19e813a4-378a-4ef0-94bb-27445b38d082","resolution":{"observed_at":"2026-08-15T20:05:31.590710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.214720Z","title":null,"venue":null,"work_id":"d7ce789e-09d6-4668-a062-0ca4dd2cc9c2","year":2021},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.595681Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:3323ee06d8d6381de384f72059c903233edc783c386f7212da833052e1fabea1","observation_id":"106432a1-6e8b-4bd2-8e90-2b0c259e0941","resolution":{"observed_at":"2026-08-15T20:05:32.218882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-15T20:05:31.600148Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.600148Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:24d02b0b18ddcf90c70588bc48bfab327b53b0af4845a4fc79a29ee19b8d05a0","observation_id":"5a983f92-8482-43b8-9d27-e5521e52ff76","resolution":{"observed_at":"2026-08-15T20:05:31.600148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.201103Z","title":null,"venue":null,"work_id":"a7f4a621-36a9-41c6-b1ea-1c70893fc1be","year":2017},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.604748Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:019f6a92be75134ce917ea1a12e191a76f024ad56f36d4dd46dd37ab0f981605","observation_id":"1ee21b18-083a-4c74-bcec-e66d553ce57a","resolution":{"observed_at":"2026-08-15T20:05:32.205147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.185996Z","title":null,"venue":null,"work_id":"80dfe81a-bff3-4bfa-8638-65f7e71a9e31","year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.609682Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:72a4c192af6af87f638a2ba0c7f57d6d57cb2ab10d2ef815f825229c8de1bf67","observation_id":"7a8b00c8-e6bd-464e-a399-b954c2be086a","resolution":{"observed_at":"2026-08-15T20:05:32.190914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.170649Z","title":null,"venue":null,"work_id":"144e087c-4691-4111-8c1d-ae54fd834038","year":2022},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.614188Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:5cdb9675283eb1fdde033d5b641a6b9d2512af1bf6924e1f57c93ee7653c8d9a","observation_id":"6f8ecf78-63bf-461e-bc25-34cbe1576fe4","resolution":{"observed_at":"2026-08-15T20:05:32.174933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:05:31.618326Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.618326Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:c2df83d2d661554c0fb66da9b0f708478f0f8b61072d0dd0c6003f6477c644e5","observation_id":"949e80b9-08c3-4453-9b34-4767c0a0ad4b","resolution":{"observed_at":"2026-08-15T20:05:31.618326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-15T20:05:31.622675Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.622675Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:f5398d489c0b4271e116e6dd21fbb35cd4953e4c350e8879e18b4f0dd604f73f","observation_id":"1f555ad7-3f81-4d55-8f49-659d81fb7a46","resolution":{"observed_at":"2026-08-15T20:05:31.622675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.155820Z","title":null,"venue":null,"work_id":"2df2ca6d-4567-40fc-9f78-c5c58c4df322","year":2013},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.627198Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:af1b2855fe6e2ce697a3135c7819dea3ab8f640b42ab0c5d1889793b7b783fb4","observation_id":"a5a9f747-2389-4d26-a411-fdf8081ee5a0","resolution":{"observed_at":"2026-08-15T20:05:32.160669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-19T16:38:51.329886Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-15T20:05:31.631560Z","title":"Smith, Daniel Khashabi, and Han- naneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.631560Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:ca625260a67647d0d356edeec62ca26af70294e8cba670d8e8062a97a6bcf3a5","observation_id":"31b1ff6b-7e2c-4959-a628-6cf75bc87fc2","resolution":{"observed_at":"2026-08-15T20:05:31.631560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.139891Z","title":null,"venue":null,"work_id":"615ad068-f061-47b2-a968-a76e6f6ee84f","year":2022},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.636202Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:12540b2a7721bc6806e8cb38753371fca76310ea0d2537edcefc940fc6f581f3","observation_id":"f9d7fb50-b75e-4583-9a67-7d0e16bb91c5","resolution":{"observed_at":"2026-08-15T20:05:32.145059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.124119Z","title":null,"venue":null,"work_id":"70c6c7a9-12a7-4a9b-8621-40f00ca6c500","year":2019},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.640780Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:6235cd92c9d0ebf5877418a9a1d020f5b44178dd6b0470963db2c3641447d0d1","observation_id":"c34669e9-943d-4f16-a5f0-7a93d53c858b","resolution":{"observed_at":"2026-08-15T20:05:32.129144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-15T20:05:31.645549Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.645549Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:d231439eaafc46ce916048045a56b62ab72e0c19f0d11f38e79d9de1123a94e5","observation_id":"8c3e294d-b36e-4c4d-909c-064cf5a542f5","resolution":{"observed_at":"2026-08-15T20:05:31.645549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-15T20:05:31.650412Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.650412Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:73f4224ba02acb318f39a2f63227daef2761ae97b2dc2937f7611cf850fec5b6","observation_id":"9e5c5b25-3196-4588-8f27-ccc4be72a43d","resolution":{"observed_at":"2026-08-15T20:05:31.650412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.108828Z","title":null,"venue":null,"work_id":"64a12c40-9254-4229-b488-6cc4ae169c9e","year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.655494Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:7922f1cfeaf8e05626dfcd1b28342a573cebfc9c3f244883bab35b0843dbb2f8","observation_id":"07f7870a-54f2-4b9c-a682-a0d3cdacb867","resolution":{"observed_at":"2026-08-15T20:05:32.113740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-21T02:11:05.377768Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14838","snapshot_observed_at":"2026-08-15T20:05:31.660385Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.660385Z"},"links":{"cited_paper":"/paper/2412.14838","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:e0807852310db37ebd513bb8e26d7353789951a9d256202a03172c955ffcfe46","observation_id":"4e5f724b-9e46-495c-888a-7fda1017ab42","resolution":{"observed_at":"2026-08-15T20:05:31.660385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6016.9018","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:31.775723Z","title":"Dai, Zhifeng Chen, Quoc V Le, and James Laudon","venue":null,"work_id":"90c0660b-1caf-434e-88c5-86076b2aaa29","year":2022},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.666299Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:cdf6613eecec9acdcad58e9b096dac893614882bb3ec37252904739330fd5491","observation_id":"e6f68839-ee51-4381-8175-0f8082aaccd6","resolution":{"observed_at":"2026-08-15T20:05:31.786451Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T20:05:31.439165Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.439165Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:5ff9f49a308a603502d58bff6245f1725a31854957e88e993d3fa9d9c0b0a09a","observation_id":"e93e48a6-9435-4b56-ac0a-fed45b3c2f42","resolution":{"observed_at":"2026-08-15T20:05:31.439165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:32.387184Z","title":"InThe 2023 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":"391f922e-b007-42f3-9f32-d2d157cf168c","year":2023},"citing_paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:31.395065Z"},"links":{"citing_paper":"/paper/2506.13541"},"observation_digest":"sha256:afe8bdf0dd5f47d2c68c3a8148c9cc6361781a5f97ba12d9fc53183150ee7224","observation_id":"732a1a50-0158-4b83-ac0a-2a7b6ea6d7ce","resolution":{"observed_at":"2026-08-15T20:05:32.392001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13541","last_updated":"2025-06-16T14:30:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T00:07:46.417252Z","submitted_at":"2025-06-16T14:30:17Z","title":"Mixture of Weight-shared Heterogeneous Group Attention Experts for Dynamic Token-wise KV Optimization"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.13541."}