{"as_of":"2026-08-09T09:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfc0a692a7abd26534ce6c631538642dd3d506a7b2ebc96feb423fc227b72b61","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:55:12.532975Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:32:37.642188Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:57:51.549825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"cited_work":{"arxiv_id":"2508.15881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15881","snapshot_observed_at":"2026-07-11T01:57:51.549825Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","venue":"cs.LG","work_id":"e46d236d-5d93-4da9-8236-fd22cd1117a0","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-05T07:46:13.093303Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T22:38:12.637901Z"},"links":{"cited_paper":"/paper/2508.15881","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:2fe69d94f3e5ecfb2549bc285b2ca8c5fafbf6294b2126fb4895bc3f0cad5f86","observation_id":"bb906a33-09fe-4c7b-bf98-729123df890d","resolution":{"observed_at":"2026-07-08T22:45:40.138975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"cited_work":{"arxiv_id":"2508.15881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15881","snapshot_observed_at":"2026-07-11T01:57:51.549825Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","venue":"cs.LG","work_id":"e46d236d-5d93-4da9-8236-fd22cd1117a0","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-05T07:46:13.093303Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T01:55:09.658053Z"},"links":{"cited_paper":"/paper/2508.15881","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:7aac1487bfdfdb8afbcb07c5661b810bbb3db78ce285a9965becf82e5ac3e45f","observation_id":"f560a902-6b34-41e3-84c4-5b085714bdde","resolution":{"observed_at":"2026-07-11T01:57:51.582428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15881","snapshot_observed_at":"2026-08-01T17:32:37.642188Z","title":"Inference/decode only","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-07T15:41:17.993721Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.642188Z"},"links":{"cited_paper":"/paper/2508.15881","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:75424bf80b0343142a89d064181b9d60d4f7dad5a893bd5c3dc9d21708ce2140","observation_id":"6107027a-ed16-41c6-ab09-fbc260fc3daa","resolution":{"observed_at":"2026-08-01T17:32:37.642188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.15881/citation-record","integrity":"/paper/2508.15881/integrity","json":"/paper/2508.15881/citation-record.json","paper":"/paper/2508.15881"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:05.969609Z","title":"Hello GPT-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:05.969609Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:7e09f5d281fea820809656e1d36603c5940b6cd18fbf1754bda68e90dbe0bfc4","observation_id":"6edc2b6b-c2c2-4309-9ccc-ad3b0e024c57","resolution":{"observed_at":"2026-08-05T17:55:05.969609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:06.070966Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.070966Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f401e20a92d39cd8dd551481af7cc198d1257eef46b1dbded1bcd8fd542f98d3","observation_id":"fa797d20-45f1-49d0-a11c-81497eb6b47f","resolution":{"observed_at":"2026-08-05T17:55:06.070966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T17:55:06.170024Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.170024Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:7c37b9deae76bc842382b9039d60a61c3b53637a042f482232b66a228dc15814","observation_id":"965d0c1e-df52-49f4-ba11-53487b71ee5c","resolution":{"observed_at":"2026-08-05T17:55:06.170024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:06.200705Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.200705Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:95f07c2b0c7c4e24bf696c71bf2b2623aa6e1998348beb4b9cf4eccdc02d3e9d","observation_id":"7f5385e1-57fc-40a2-9fbf-8c44ec7646e5","resolution":{"observed_at":"2026-08-05T17:55:06.200705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:06.281785Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.281785Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:967a638fe184fd125df3367bd32ded7fb4eb7329b23234a2ce38e986bdd02046","observation_id":"340b23cc-06af-434f-8069-893f1b047482","resolution":{"observed_at":"2026-08-05T17:55:06.281785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-05T17:55:06.348432Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.348432Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:fa5a0a52403b3bcb26b786f5e6b0b7b4f998d3a4bdff9670f1f1b71292d82cee","observation_id":"f929d593-9219-4713-9a8b-eef18834e01c","resolution":{"observed_at":"2026-08-05T17:55:06.348432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18893","last_updated":"2026-05-27T05:57:00Z","snapshot_observed_at":"2026-08-07T16:40:35.127363Z","submitted_at":"2025-03-24T17:06:37Z","title":"xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18893","snapshot_observed_at":"2026-08-05T17:55:06.405836Z","title":"xkv: Cross-layer svd for kv-cache compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.405836Z"},"links":{"cited_paper":"/paper/2503.18893","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:6eead9517a3bee3c004a900ac70c665bc59098e0339794bdee2d8fcf5855dd8f","observation_id":"ec240f3a-ad6f-416e-a183-1e108f27f7a8","resolution":{"observed_at":"2026-08-05T17:55:06.405836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-05T17:55:06.525852Z","title":"Transformers are multi-state rnns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.525852Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:8b6d8acd06ebcd7d0d175ea220d65461f38516e80d53eda0f4b20f66c6ec3e63","observation_id":"9a51bea7-5360-48d8-995f-7b83e8aec3b8","resolution":{"observed_at":"2026-08-05T17:55:06.525852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T17:55:06.637672Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.637672Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:6b4ea8fb796769ef1155facbb7fc35d40e93ca4aafa4f7ccf018c759ad4e6450","observation_id":"1c7d8e1c-4d26-40de-a192-56676940206f","resolution":{"observed_at":"2026-08-05T17:55:06.637672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06589","last_updated":"2025-06-19T06:06:08Z","snapshot_observed_at":"2026-07-06T20:19:45.569377Z","submitted_at":"2025-01-11T17:06:30Z","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06589","snapshot_observed_at":"2026-08-05T17:55:06.756104Z","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.756104Z"},"links":{"cited_paper":"/paper/2501.06589","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:2f4cfc027dea5318c23530a9933a6f89438448e042699039ae307eb279b23901","observation_id":"f9d7552b-b5c9-49af-b04f-21d5462056a3","resolution":{"observed_at":"2026-08-05T17:55:06.756104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20727","last_updated":"2025-06-01T00:33:25Z","snapshot_observed_at":"2026-08-07T17:40:54.883495Z","submitted_at":"2025-02-28T05:20:48Z","title":"SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models","version":4},"cited_work":{"arxiv_id":"2502.20727","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20727","snapshot_observed_at":"2026-08-05T17:55:15.131238Z","title":"SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models","venue":"cs.DC","work_id":"305a4388-6626-4053-b8ef-431a4f7b393c","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.872252Z"},"links":{"cited_paper":"/paper/2502.20727","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:a8628af940fd877dbd08f0a99c417f565d5e9d75b954dcf959aff59bd7315cdc","observation_id":"d9e895fb-9fb8-4df6-b298-9f9d347da560","resolution":{"observed_at":"2026-08-05T17:55:15.253571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19645","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:14.835775Z","title":"Tensor-parallelism with partially synchronized activations","venue":null,"work_id":"2c0da626-2202-4b62-8600-23030dbdcdc4","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.984488Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:18a7995597fea7ea5b2d13bec0d80145bab973f405e9a027a8d65da49c275052","observation_id":"d5560a2c-a598-4adb-8bf2-445f2ebf7791","resolution":{"observed_at":"2026-08-05T17:55:14.958729Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04964","last_updated":"2024-12-11T13:27:00Z","snapshot_observed_at":"2026-07-06T20:02:43.795985Z","submitted_at":"2024-12-06T11:29:32Z","title":"Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04964","snapshot_observed_at":"2026-08-05T17:55:07.138663Z","title":"Flash com- munication: Reducing tensor parallelization bottleneck for fast large language model inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.138663Z"},"links":{"cited_paper":"/paper/2412.04964","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:4f19fdcf99af1f943d1f07245d9225b7c0ca1b455fa75477fca2cce35e14d163","observation_id":"cdaf4a06-f029-4ae2-8f28-43a37df27a65","resolution":{"observed_at":"2026-08-05T17:55:07.138663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T17:55:07.250063Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.250063Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:a5ad4c5d15c53a1b2b7daf79b3c0f6040993273e59fd7e1ccb7a2142d032f84f","observation_id":"90d1014f-f333-4cb1-9c37-0284d893ebb7","resolution":{"observed_at":"2026-08-05T17:55:07.250063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T17:55:07.365952Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.365952Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:a4ab246f6d57f62bfe83d3a132c81b09aa1c545ee736c85e2ec68f14a73cdb02","observation_id":"e348d791-4afe-4c49-ae5b-11306a7fa47e","resolution":{"observed_at":"2026-08-05T17:55:07.365952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-08T11:39:25.654067Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07864","snapshot_observed_at":"2026-08-05T17:55:07.508723Z","title":"Transmla: Multi-head latent attention is all you need","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.508723Z"},"links":{"cited_paper":"/paper/2502.07864","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:de14348f29183ccd5bd2abeb9b3b8d26a39770ffe8b5c84218ccab796f6203bf","observation_id":"63dff6cf-7348-463e-be2b-411436252875","resolution":{"observed_at":"2026-08-05T17:55:07.508723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T17:55:07.673578Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.673578Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f2712765f9c7fa192d44aea8e7fb3bd0534cf03530ec3639bbc3b6e44189476e","observation_id":"975fa342-94ee-49e6-911b-192190c4e5a3","resolution":{"observed_at":"2026-08-05T17:55:07.673578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:07.854166Z","title":"Llama 3 model card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.854166Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:aba10d4a64895f760ce4c4f85eacb52fe35bf745990e136f64841654e0b67411","observation_id":"0065ab31-3123-4b57-b276-47b67095ef55","resolution":{"observed_at":"2026-08-05T17:55:07.854166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T17:55:07.985138Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.985138Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:cf67bcaec9c9518cb0cc36703c7e7e32d9f8ac0a7a14bb6f36aac8374c160b06","observation_id":"c2c7fda1-37fe-49d8-a9a4-a5142ac201f7","resolution":{"observed_at":"2026-08-05T17:55:07.985138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-08-05T17:55:08.095113Z","title":"Hardware-efficient attention for fast decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.095113Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:d7daec1306a1f692ccd588a37416d6f7b43a6920e9c9b41197b39b22a890bfff","observation_id":"3a655ef5-cf0b-481a-a0e3-b783519b25c6","resolution":{"observed_at":"2026-08-05T17:55:08.095113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T17:55:08.179444Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.179444Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:685cefb164a1395c35bb45316a8c797251bba01ddf35152971e3062d3328fc04","observation_id":"bf4903d4-8734-4d1d-8c41-e98c273649d9","resolution":{"observed_at":"2026-08-05T17:55:08.179444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-02T23:02:03.395024Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14838","snapshot_observed_at":"2026-08-05T17:55:08.261078Z","title":"Dynamickv: Task-aware adaptive kv cache compression for long context llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.261078Z"},"links":{"cited_paper":"/paper/2412.14838","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:e84f99049f3e16c19c7feb0bec47d7bac92db87bfeb760959ef6e468113d0bf7","observation_id":"bb8e1ff1-35dd-4b7e-bb30-414854bdeb30","resolution":{"observed_at":"2026-08-05T17:55:08.261078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02401","last_updated":"2025-08-04T13:26:16Z","snapshot_observed_at":"2026-08-09T03:46:52.706849Z","submitted_at":"2025-08-04T13:26:16Z","title":"CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02401","snapshot_observed_at":"2026-08-05T17:55:08.361255Z","title":"Compresskv: Semantic retrieval heads know what tokens are not important before generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.361255Z"},"links":{"cited_paper":"/paper/2508.02401","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:3f6a1ba6808c8a1c6f4eecb38edd75ca06a50bc787a32c5f72c0921094d5a554","observation_id":"74ef57b3-bd3a-4e58-9d51-25808beb877d","resolution":{"observed_at":"2026-08-05T17:55:08.361255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-05T17:55:08.477550Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.477550Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:5e04395790a34ec5d226e3d3e69f272688ba30254d048997ebfccc5bfc3aa9ff","observation_id":"01c6fd89-3438-408f-9755-0f5b15e2ed3f","resolution":{"observed_at":"2026-08-05T17:55:08.477550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-05T17:55:08.556414Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.556414Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:4ce65992b0536ed266c029d001ce647433ceb0435cd1f39deff2a482262a6643","observation_id":"d7ec6af8-00c3-42e1-aba7-a1a71f7b5545","resolution":{"observed_at":"2026-08-05T17:55:08.556414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T17:55:08.677974Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.677974Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:48a5650f428c97a8c88380a1014b79a6af62b6bc60f03c7e564595010ed1daeb","observation_id":"f9828a0e-fcb4-4bdf-be76-030d6eaa0a87","resolution":{"observed_at":"2026-08-05T17:55:08.677974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-05T17:55:08.753827Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.753827Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f5e3b2bf5b1488b8f2afa2407736ee8c67a18ce2a9336cac5c6cbb7633ac097c","observation_id":"53b418c4-ede0-4354-bc8b-8640b51de096","resolution":{"observed_at":"2026-08-05T17:55:08.753827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:08.857090Z","title":"Zsmerge: Zero-shot kv cache compression for memory-efficient long-context llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.857090Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:217b7713a6f607b7fa4d24c4866784265f5121c4d14d9e6bb7a390d30151c34c","observation_id":"64f9f956-7c89-4b28-920a-cdc8de6a3b42","resolution":{"observed_at":"2026-08-05T17:55:08.857090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.11418","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:14.270235Z","title":"Efficient long-context llm inference via kv cache clustering","venue":null,"work_id":"78c6d959-e17d-414e-b254-b9b73264e5da","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.971911Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f0034a6ab0d39d9c6b664749efe5fbda9cbab39714085dc15c085ab42f1d198f","observation_id":"f168205e-0307-4026-8c99-cef1defffce9","resolution":{"observed_at":"2026-08-05T17:55:14.366584Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18517","last_updated":"2024-10-24T08:06:41Z","snapshot_observed_at":"2026-08-06T20:05:52.541270Z","submitted_at":"2024-10-24T08:06:41Z","title":"KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18517","snapshot_observed_at":"2026-08-05T17:55:09.149968Z","title":"Kvsharer: Efficient inference via layer-wise dissimilar kv cache sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.149968Z"},"links":{"cited_paper":"/paper/2410.18517","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:c29a9ccdb1fd3799aae60dd88d126db117515de2bccaea81b10f1fcb54218e92","observation_id":"9d040f08-9e60-418b-ae63-6fe5022c1419","resolution":{"observed_at":"2026-08-05T17:55:09.149968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15012","last_updated":"2024-09-23T13:37:25Z","snapshot_observed_at":"2026-08-03T16:18:20.833189Z","submitted_at":"2024-09-23T13:37:25Z","title":"Inference-Friendly Models With MixAttention","version":1},"cited_work":{"arxiv_id":"2409.15012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15012","snapshot_observed_at":"2026-08-05T17:55:13.970681Z","title":"Inference-Friendly Models With MixAttention","venue":"cs.CL","work_id":"f3d29a3e-48bf-44f4-9b90-25c5a30ff5b1","year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.267444Z"},"links":{"cited_paper":"/paper/2409.15012","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:485ebcd23082c4c30dd7f835ef9594b87c7df85b22b9daa16b730c59f433ae80","observation_id":"0279807a-455a-42b3-9ac9-00da505464b2","resolution":{"observed_at":"2026-08-05T17:55:14.064205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10637","last_updated":"2024-06-04T00:08:10Z","snapshot_observed_at":"2026-07-06T18:15:42.050651Z","submitted_at":"2024-05-17T08:59:46Z","title":"Layer-Condensed KV Cache for Efficient Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10637","snapshot_observed_at":"2026-08-05T17:55:09.408451Z","title":"Layer-condensed kv cache for efficient inference of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.408451Z"},"links":{"cited_paper":"/paper/2405.10637","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:2fc34c9d6429eb79b1e712cea2960a031060c5607a307436f7324f992f7263e6","observation_id":"60be5ed8-16ce-4a7e-941f-1cd3df3493bf","resolution":{"observed_at":"2026-08-05T17:55:09.408451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14442","last_updated":"2025-02-05T08:22:05Z","snapshot_observed_at":"2026-08-09T03:16:25.928338Z","submitted_at":"2024-10-18T13:01:14Z","title":"A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference","version":2},"cited_work":{"arxiv_id":"2410.14442","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14442","snapshot_observed_at":"2026-08-05T17:55:13.769817Z","title":"A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference","venue":"cs.CL","work_id":"5d6339d1-83b4-4ae1-b1b4-c76128fc4f2d","year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.555984Z"},"links":{"cited_paper":"/paper/2410.14442","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:be616e72cb3e12e6e97e20d691b7016060ffd6441164981fab0f883dcd23309f","observation_id":"e62bd1eb-86d9-4cb8-8820-9fec1ed413d2","resolution":{"observed_at":"2026-08-05T17:55:13.833354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-02T00:33:35.724101Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-05T17:55:09.661574Z","title":"Reducing transformer key-value cache size with cross-layer attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.661574Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:02ccfc41469a70963020308daa430142297ce7a756b42332733fa117d3571778","observation_id":"6d5022ab-4df1-4ddb-b02e-098ef4e89e67","resolution":{"observed_at":"2026-08-05T17:55:09.661574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03111","last_updated":"2024-10-04T03:10:53Z","snapshot_observed_at":"2026-07-06T19:27:29.609371Z","submitted_at":"2024-10-04T03:10:53Z","title":"LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03111","snapshot_observed_at":"2026-08-05T17:55:09.743965Z","title":"Lorc: Low-rank compression for llms kv cache with a progressive compression strategy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.743965Z"},"links":{"cited_paper":"/paper/2410.03111","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:53bb43c8599f1a495d9740c391e51ca2e5fbcaee5e80c75aaf309233299fcde7","observation_id":"0c0fb4e1-5587-4190-a412-ac69e2e71b3b","resolution":{"observed_at":"2026-08-05T17:55:09.743965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14731","last_updated":"2025-05-16T09:40:01Z","snapshot_observed_at":"2026-07-06T19:36:10.759412Z","submitted_at":"2024-10-16T08:34:51Z","title":"MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14731","snapshot_observed_at":"2026-08-05T17:55:09.824153Z","title":"Matryoshkakv: Adaptive kv compression via trainable orthogonal projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.824153Z"},"links":{"cited_paper":"/paper/2410.14731","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:5de2fafc71b305681a8434ffe1063fd26b23c65de56e0091e65a660917c2a6b8","observation_id":"2434c60e-8e4b-408c-8625-af96bc073b3c","resolution":{"observed_at":"2026-08-05T17:55:09.824153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-05T17:55:09.928919Z","title":"Effectively compress kv heads for llm.arXiv preprint arXiv:2406.07056, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:09.928919Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:6a0255618a91e927e51b424077df181c8817f8628fb25322ae75ec1fc3678150","observation_id":"129d056b-aa76-4449-8ef0-fd01fe67112e","resolution":{"observed_at":"2026-08-05T17:55:09.928919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T17:55:10.035877Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.035877Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:6f3ded00763afaaaa2a4bbfd9b69ae91be0da2eb7e11baf0540eba082a29a1dc","observation_id":"30df9cd3-da21-4b66-94cc-6e529e1f16c4","resolution":{"observed_at":"2026-08-05T17:55:10.035877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03661","last_updated":"2025-04-08T04:34:44Z","snapshot_observed_at":"2026-08-07T17:10:04.111810Z","submitted_at":"2025-03-12T13:32:50Z","title":"MILLION: Mastering Long-Context LLM Inference Via Outlier-Immunized KV Product Quantization","version":2},"cited_work":{"arxiv_id":"2504.03661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.03661","snapshot_observed_at":"2026-08-05T17:55:13.472060Z","title":"MILLION: Mastering Long-Context LLM Inference Via Outlier-Immunized KV Product Quantization","venue":"cs.DC","work_id":"7af03136-e09a-43c9-883d-f1d7db832e41","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.191982Z"},"links":{"cited_paper":"/paper/2504.03661","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:fd5cea9751166506eb253b6e189e538e7309072ce04444ef77d7a2469e4f88e1","observation_id":"406bcb6e-4a11-4d5f-a52a-d2c81af75543","resolution":{"observed_at":"2026-08-05T17:55:13.570436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-05T17:55:10.297309Z","title":"Qaq: Quality adaptive quantization for llm kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.297309Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:d02142a984ab96e511fe56ee2dc91a4860f89cd2aa32d3040b145054a0a844d4","observation_id":"4e4f6c27-5b95-414c-8f31-40f5ea2c1fff","resolution":{"observed_at":"2026-08-05T17:55:10.297309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19586","last_updated":"2025-05-27T03:16:32Z","snapshot_observed_at":"2026-08-09T03:49:29.261093Z","submitted_at":"2025-05-26T07:00:04Z","title":"TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization","version":2},"cited_work":{"arxiv_id":"2505.19586","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19586","snapshot_observed_at":"2026-08-05T17:55:13.328095Z","title":"TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization","venue":"cs.CL","work_id":"5513fbf1-372d-4b64-a37e-eafa041e9116","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.372511Z"},"links":{"cited_paper":"/paper/2505.19586","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:9b2c4fb4dc29807fbad7ddcc3be10fc7f400fc31c5b1a5aa444c542f1f1ef25d","observation_id":"06792c92-3127-4413-b66c-d107532327c0","resolution":{"observed_at":"2026-08-05T17:55:13.365091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:10.478577Z","title":"Large scale distributed deep networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.478577Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:2ec863b29d195e58c9fafb1ae0921abdfe1aabcd6096ca4c418bf8ff9284da37","observation_id":"06455c16-75ee-45b9-a55e-80ba7532ad83","resolution":{"observed_at":"2026-08-05T17:55:10.478577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05799","last_updated":"2018-02-21T04:30:30Z","snapshot_observed_at":"2026-07-06T06:23:45.215820Z","submitted_at":"2018-02-15T23:36:51Z","title":"Horovod: fast and easy distributed deep learning in TensorFlow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05799","snapshot_observed_at":"2026-08-05T17:55:10.614756Z","title":"Horovod: fast and easy distributed deep learning in tensorflow","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.614756Z"},"links":{"cited_paper":"/paper/1802.05799","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:2f80767f2ef8b99c25c007bb044d7b691c860970a92ed1f22861096e5338aaa1","observation_id":"5ed51e7b-2b70-4475-a962-b76d80725d2e","resolution":{"observed_at":"2026-08-05T17:55:10.614756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:10.743554Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.743554Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:ea4c615dba38690d15581220a5c9c118df13015ac26ebbfac08a873a2f00452d","observation_id":"1925cf9e-10c1-4370-867c-5a8b2a871581","resolution":{"observed_at":"2026-08-05T17:55:10.743554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:10.818690Z","title":"Pipedream: Generalized pipeline parallelism for dnn training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.818690Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:37e978749981a42fb12c4074f09da200125604733394ccc83fb4b555d8134ea2","observation_id":"7396cf27-1e60-4aa8-96ba-124365c1f946","resolution":{"observed_at":"2026-08-05T17:55:10.818690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T17:55:10.957633Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.957633Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:db1930df81591c3dd3dd127354cf064eb613864a6f5c179c0c40fd8fea57b7af","observation_id":"69d8ba3e-4312-4cc6-a132-ffc9930d9915","resolution":{"observed_at":"2026-08-05T17:55:10.957633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05343","last_updated":"2021-04-12T10:47:16Z","snapshot_observed_at":"2026-08-02T01:58:42.605789Z","submitted_at":"2021-04-12T10:47:16Z","title":"An Efficient 2D Method for Training Super-Large Deep Learning Models","version":1},"cited_work":{"arxiv_id":"2104.05343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.05343","snapshot_observed_at":"2026-08-05T17:55:13.097943Z","title":"An Efficient 2D Method for Training Super-Large Deep Learning Models","venue":"cs.LG","work_id":"0599e45c-292a-415f-93ac-4571a29ee09b","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.079164Z"},"links":{"cited_paper":"/paper/2104.05343","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:91ff116a1d9e8ec8f2757d6b3d1a30de547e397b6e1c0c9ba970e1fc27fdd726","observation_id":"1771d614-49e7-4410-b557-3a488ece433a","resolution":{"observed_at":"2026-08-05T17:55:13.186945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14450","last_updated":"2021-05-30T07:41:08Z","snapshot_observed_at":"2026-07-06T11:14:04.454155Z","submitted_at":"2021-05-30T07:41:08Z","title":"Maximizing Parallelism in Distributed Training for Huge Neural Networks","version":1},"cited_work":{"arxiv_id":"2105.14450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14450","snapshot_observed_at":"2026-08-05T17:55:12.935227Z","title":"Maximizing Parallelism in Distributed Training for Huge Neural Networks","venue":"cs.DC","work_id":"1cc87e93-4224-4a25-a565-b04a8bbb632f","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.149864Z"},"links":{"cited_paper":"/paper/2105.14450","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:6da4fa1bb54371f0faaebba5ec4ca028844e306b3226065de7cb41c6db65887f","observation_id":"16c73e13-a6d2-4f21-b730-3382a05f53b1","resolution":{"observed_at":"2026-08-05T17:55:13.001003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-05T17:55:11.234042Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.234042Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f04a725fdd476f9dff4675d7dd66cf962731011b6d2460f95543f3815062ddb0","observation_id":"dc945350-74c7-40d7-a7fe-22216310527c","resolution":{"observed_at":"2026-08-05T17:55:11.234042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.866247Z","title":"NVIDIA dynamo, a low-latency distributed inference framework for scaling reasoning ai models","venue":null,"work_id":"07b79281-14a2-4709-a234-3cd24b266c22","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.341384Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:5a0cc7768cc21d84b823025e7e15d48c32d10bc0e3ad76343341b8d944053c4f","observation_id":"70ef7060-1cc4-4fb6-a21a-afd6fa062cb5","resolution":{"observed_at":"2026-08-05T17:55:16.949194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18454","last_updated":"2026-04-15T08:07:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T06:37:29Z","title":"Sandwich: Joint Configuration Search and Hot-Switching for Efficient CPU LLM Serving","version":2},"cited_work":{"arxiv_id":"2507.18454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.18454","snapshot_observed_at":"2026-08-05T17:55:12.700761Z","title":"Sandwich: Joint Configuration Search and Hot-Switching for Efficient CPU LLM Serving","venue":"cs.AR","work_id":"cbf89c26-41e9-48df-afaa-de05f7d9279e","year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.419047Z"},"links":{"cited_paper":"/paper/2507.18454","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:33e149010e7100d474c53de8f7e2a07e0392cfb56911aee1143d273ca31b5036","observation_id":"0ef47a78-7883-4088-bfe2-a993c0cb07fa","resolution":{"observed_at":"2026-08-05T17:55:12.797644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:11.497826Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.497826Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:0ace11603d32e6457eac55268041b3e00d01d9b01224a7aa59a2436100c0b358","observation_id":"5ae5a0c8-de1c-46c6-ae05-062650b6c4ca","resolution":{"observed_at":"2026-08-05T17:55:11.497826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T17:55:11.586104Z","title":"Deepseek LLM: scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.586104Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f747492cebf8e74c00f994822b2531eca92d7fa83dc5968aaf8786c0819f7fb1","observation_id":"2bb093de-5471-4821-a6ec-228d975ac973","resolution":{"observed_at":"2026-08-05T17:55:11.586104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T17:55:11.656509Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.656509Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:7a6adf2ee959ce12f513fac34f42cff9544bafefebb027709691cdc743922cfe","observation_id":"f1dab253-a3ef-4535-9418-2b625967db27","resolution":{"observed_at":"2026-08-05T17:55:11.656509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.629238Z","title":"Mea- suring massive multitask language understanding","venue":null,"work_id":"a27b779a-3979-4960-a050-88cc628165f2","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.777292Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:dd3f486966162ef69733ced96ee959a127934a0bdf423b0e7ce27c4422f43b58","observation_id":"986acead-968f-4d81-a5cd-48dded46847d","resolution":{"observed_at":"2026-08-05T17:55:16.735462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T17:55:11.883455Z","title":"Think you have solved question answering? try arc, the AI2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.883455Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:203df2fc508d204de133051b4618db36018d73212d871a76ca47f5ed512e3781","observation_id":"62c1e467-c512-4891-a383-774e9c6755cc","resolution":{"observed_at":"2026-08-05T17:55:11.883455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.427608Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":"a7540ebd-8fb5-4b66-95d8-712f61a24689","year":2020},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.978403Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:41cd2a08c59874548c95d3c11723113af0df5859fd653bcb686703bdaab3e603","observation_id":"ce74745c-520b-4f95-a0a1-213aede0a115","resolution":{"observed_at":"2026-08-05T17:55:16.503922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:16.156908Z","title":"Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R","venue":null,"work_id":"145b57fb-56b4-42bc-af52-ef77cb51f3ab","year":2019},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.075515Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:e4af841cf12e18c8c8dc0db6bae134502f43fc1e023c918de848c4a2c57df933","observation_id":"8dfad646-0691-4224-80fa-631e4c3e4c13","resolution":{"observed_at":"2026-08-05T17:55:16.307242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:15.963327Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":"01b9d21b-3444-4633-ad1c-a8de0fc2a660","year":2018},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.167299Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:5c84fb57e5ecc0adcd649b6adc20f4c002b37b4fae9127b4aaf6413a8b85b5d9","observation_id":"7a14dcce-2508-4c20-9d78-59ed1a8a7e84","resolution":{"observed_at":"2026-08-05T17:55:16.074606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:15.705659Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":"52284a49-3f0d-474e-a3ce-6f945e8c284a","year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.240880Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:fc584e466dd19fcafd6d224764c050dcedf18695049bdda96ec3158b10b8703a","observation_id":"f753b1f5-1f3a-4978-ae79-f8259aa643e9","resolution":{"observed_at":"2026-08-05T17:55:15.841490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:12.333239Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.333239Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:5053d89e8f8b79fbcbb8c2835409e0fec0c024066aa0d72384a25e130de47dd9","observation_id":"e9d15e7c-55ff-4312-b58a-8c29caef111c","resolution":{"observed_at":"2026-08-05T17:55:12.333239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:55:15.473433Z","title":"Smollm-corpus","venue":null,"work_id":"2d3c6e57-54d9-452c-9c98-1d1a4df5050f","year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.427182Z"},"links":{"citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:4cbd05937c64f33ab2f1da689138025b1458c988a4fda9e630e12cf53606e107","observation_id":"4bcaf792-9df4-4cac-a2a0-7e6b2e80661b","resolution":{"observed_at":"2026-08-05T17:55:15.579058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T17:55:12.532975Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:12.532975Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:05e6b65788350c428d3d51b5d55179c5fdcc36ce2ecab1ccf1c0e84760cfeec8","observation_id":"150c8a9f-d5b0-4fb1-9061-5f6866b520a0","resolution":{"observed_at":"2026-08-05T17:55:12.532975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":10,"verified_fuzzy":7},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 3 inbound Pith citation observations for arXiv:2508.15881."}