{"as_of":"2026-08-11T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdaaf0527e3849443fa666000fa92a8877479c8d4a87ef4b2c51038dfd3c90a9","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T02:54:11.777615Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29207/citation-record","integrity":"/paper/2606.29207/integrity","json":"/paper/2606.29207/citation-record.json","paper":"/paper/2606.29207"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:400912f290cf462597655cd95bae91df44e809caaee38bbaa66b050ed10fdcbc","observation_id":"fe7376e2-ea5a-4d37-add5-09056dfb6d34","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:14.688265Z","title":"CONCUR: High-throughput agentic batch inference of LLM via congestion-based concurrency control.arXiv preprint arXiv:2601.22705","venue":null,"work_id":"34b0e739-06d8-4c38-acef-4603c6f480a3","year":2026},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:3956c87815cea74478780b4ed54fef2eb523af787ad3d9af18d43b8fb6f8efe1","observation_id":"d25d1953-9c09-4cf4-b309-3134ed018d6f","resolution":{"observed_at":"2026-06-30T03:04:14.254956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:a6e6897aed122bb54449a4c3a6ad8a07ce294d0867572991e00d74b9906fc507","observation_id":"41dcbe9c-0c08-4e4a-8bfc-9dd7f5679af0","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:59c794d8d3e5e1fbd03d0390cf13b0735328556b7109f2fe92560e2e37eeae09","observation_id":"d67e1e4d-a683-4286-9711-5432ebc161c2","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:a59413f43216262b896f07ec27a5bb1927e3128e973f30ae7143b059f210866d","observation_id":"c54d6505-605c-4cab-b07d-925fb5e10c9e","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:2aff2800e76c83b68469bfb5f1347f27cb84ca08bf785e624274ab716a387fc3","observation_id":"fa50a89c-e5bf-42d4-93b2-81e8cde0ac98","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:4009367830fc74bb546ce1fa727370c03912af6b835ad53394279973b1da019c","observation_id":"f9c73c01-3186-4420-936d-086af705281e","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:c79b4968502c51def2c240789609d223a4cbe9fd85e6e4df1a97c72d8ffd9926","observation_id":"a5a512c8-266f-4b28-bc4b-4202f6ce6f64","resolution":{"observed_at":"2026-06-30T03:04:14.212475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:ff33711461b4810b4f721293216c2285651436fde860b43986b71c07346b3bb1","observation_id":"997d0580-e239-4e76-b7b6-b1f78961ae40","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-08-11T06:18:26.517803Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":"2406.17565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-07-04T09:39:46.803577Z","title":"Memserve: Con- text caching for disaggregated llm serving with elastic memory pool.arXiv preprint arXiv:2406.17565","venue":null,"work_id":"51c7ec72-def3-42da-9410-c0152debc67f","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:407b7f09c7ea3d6b91a020db9f43cd10142edb434aa7252df48c771d64503d33","observation_id":"ef9aefc8-c8cb-4722-b9f5-3ab05fb142b0","resolution":{"observed_at":"2026-06-30T03:04:14.223576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:acffab679af48236c865f822907688e43697a9229f15beda0ebd4ea4291ff5df","observation_id":"c6592f79-3a9c-43b3-88c1-430de1a4073c","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T03:04:14.231486Z","title":null,"venue":null,"work_id":"8252667d-d7b9-4bd4-9f9b-6c9b40344f34","year":2025},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:d6e365b14822cc050534cccd9979e07d93eb61d3349ffb01abc934c221fc53ac","observation_id":"54628fc8-b21f-4a37-a66b-2aea8d0c9c70","resolution":{"observed_at":"2026-06-30T03:04:14.237137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:7248dba167b9fde59e4bacef94fd044baf7b9c652b048e188da758f65acd6628","observation_id":"66e6b0dd-2217-4ded-8784-54051512ebd8","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.36131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:46.538457Z","title":"In Proceedings of the 29th Symposium on Operating Systems Principles (SOSP ’23)","venue":null,"work_id":"4b81c090-6653-47cc-bb14-702c66f2862b","year":2023},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:6c8575c513b48dc039ce1107166cb69f2fca64e9c4b9c90362b2efc5a9d4582d","observation_id":"35c3e917-cc1a-4083-9fb4-bdabff066576","resolution":{"observed_at":"2026-06-30T03:04:14.265268Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:31052bee18525e5201f9294f4175b2b96199b1959ce3c3cfe94066095828bc87","observation_id":"f1d38012-a07f-4c57-9e7d-ee67d6f3bd26","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-11T00:55:35.992515Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:30300ea540d45d1f0c8ccc2e46a1690a715f04a9917e2af07c6275e094653197","observation_id":"0c43c7c5-d02a-4706-991e-1671fce3e692","resolution":{"observed_at":"2026-06-30T03:04:14.208841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:cf5c7a639a41da3eea22e4ec40fa7a57801bbb7402d1ba50bc338e921cd8ecb4","observation_id":"c1967422-3b95-4e7e-a473-9e005a47b312","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:0a6f5eb5821a04b0213a04c4dcab208c5898bf0f6203557dc779a3bf5aaac809","observation_id":"4e0773b8-588a-4436-879a-bfb7559130d1","resolution":{"observed_at":"2026-06-30T03:04:14.260714Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":"2310.01889","doi":"10.48550/arxiv.2310.01889","metadata_source":"pith","pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","venue":"cs.CL","work_id":"982498c4-e80e-4e66-8c44-c60813be298d","year":2023},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:efcc8c5917114fdfe502e91b39aae52be99432441df5376459cfd3841d7f69c5","observation_id":"a13546a9-8d61-4240-8055-2ed2fa3a89a5","resolution":{"observed_at":"2026-06-30T03:04:14.219523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0665.36404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T03:04:14.178232Z","title":null,"venue":null,"work_id":"6c30483a-8ea6-4297-9239-021beb8b9213","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:0a624b4950a96a3e3ec35a0eed1190591cb133a954a29047c1bb891206c8126d","observation_id":"3d97db2e-18fc-40d2-82f1-6101e92a8ea3","resolution":{"observed_at":"2026-06-30T03:04:14.180328Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":"1805.02867","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-07-04T17:50:00.641865Z","title":"Online normalizer calculation for softmax","venue":"cs.PF","work_id":"69eba45e-8338-46b7-b28a-e99bb687af56","year":2018},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:4064d5f4c2ba77baea9592522e953dc556b3e8b300ee8aaba14dc93b0d0f9885","observation_id":"6ad5adf1-b131-4df4-b2a7-108f7e5543d1","resolution":{"observed_at":"2026-06-30T03:04:14.188442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:4900b6637a920d04f619f3427fd50ed4b6bb05f58cf34416afee898a852c059f","observation_id":"d3bea937-a7f7-4853-878c-7318feead93e","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:c223eb95eb0febbfcbc43fbf29f21853a7fa13129aba490e881c412cc9187dfc","observation_id":"9be2a688-cb7b-4fec-a2f5-39d79eab3378","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-09T03:13:16.831626Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":"2310.08560","doi":"10.48550/arxiv.2310.08560","metadata_source":"pith","pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemGPT: Towards LLMs as Operating Systems","venue":"cs.AI","work_id":"2698f5ad-c84c-40ca-b839-0912dae10ba2","year":2023},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:8a065187c4c4c19c82e88936c1224311e71e468b5745e11e9a95710933dcb756","observation_id":"949f75b8-5c44-477d-b819-b7363f75e0a9","resolution":{"observed_at":"2026-06-30T03:04:14.176459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9077.2024","doi":"10.1109/isca59077.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reiner Pope, Sholto Douglas, Aakanksha Chowdhery, Jacob Devlin, James Bradbury, Anselm Lev- skaya, Jonathan Heek, Kefan Xiao, Shivani Agrawal, and Jeff Dean","venue":null,"work_id":"6a69794e-e9cd-48c9-9b7d-502b131ff6db","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:00e18bffa30c819b7d72801606c08732d02da26bd1f8dfeb898c75a9f9c4792f","observation_id":"12256fb6-6ec4-4136-8c02-12093833f48a","resolution":{"observed_at":"2026-06-30T03:04:13.705243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:c815197d11dfba02cf49554bdcff4a38e923ba5b3e1aae73b03c197c5c1857f1","observation_id":"dce82fe2-6899-4a76-ab18-64fb9f9c6ed0","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":"https://vllm.ai/blog/2026-05-06-mooncake-store","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:3128185d37215a232735cf0fe24e3e3392e77c37f5f6ba701cac87ec1b367302","observation_id":"7987c3ea-151d-40bc-a969-6c3bbda62804","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:6949d434956a983540ae750332ecde9d388f7f13b8c54ef165e18fa951dc3177","observation_id":"4691849d-b3a1-4113-8de7-04fdc8835d0d","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/hoti","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T03:04:13.698437Z","title":"Graham Lopez, Matthew B","venue":null,"work_id":"85d6456f-3ef3-4404-bc32-b0207557b8dc","year":2015},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:6c2ecb0f1f0c57fa536577bd3b7e0d4a39229ef1736db858e8b3e7e28381a218","observation_id":"8803a508-7e19-4ba7-811a-5f1fe3f14b7a","resolution":{"observed_at":"2026-06-30T03:04:13.700088Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:291e0945f9da38b6e2d8db3e8ed73bcc84b02d2ad3f41125eda62ebcbec17569","observation_id":"ac1f5f37-f81c-439b-a554-f53a4a86c4e2","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":"InProceedings of the 40th Interna- tional Conference on Machine Learning (ICML)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:3d9767593a9eed238c8f419031a2cfd96bb713c1b5438dc011faa68c12fee509","observation_id":"be7a581e-0f5a-4451-b6c0-6a1410b0eb13","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:c652cfce1531d88769df795c1e9cd2422a5e4bd77026d4370f27e6a924d6405b","observation_id":"89db038f-bc64-4bd1-b001-471606a21070","resolution":{"observed_at":"2026-06-30T03:04:14.170976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:8c73ea3d514571c481d9ebaad5150fa57f7ef587e69eaac9820d6737b2907a2c","observation_id":"3e56425c-2ba6-40b1-a5f4-ae240261e427","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:e29324e7386e73849d78dfaf03ea35a0b0b77014aea13ffd281f7b6b9aa47bf4","observation_id":"683ca576-4ec4-45a9-9f5f-cab250b9ccd5","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4715.369594","doi":"10.1145/3694715.3695942","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In Proceedings of the ACM SIGOPS 30th Symposium on Operating Systems Principles (SOSP '24), 2024","venue":null,"work_id":"e2683fd1-07ef-4b19-8011-f1f427683ccc","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:247dae57d741d713f9ad35c080d84e5a7100927d14cbc4d965246947f5497bef","observation_id":"58ecf3bc-65b8-4c89-a3fc-f269709113c8","resolution":{"observed_at":"2026-06-30T03:04:13.710550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09505","last_updated":"2026-04-12T10:29:26Z","snapshot_observed_at":"2026-07-06T22:28:48.082201Z","submitted_at":"2025-09-11T14:49:50Z","title":"Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference","version":3},"cited_work":{"arxiv_id":"2509.09505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.09505","snapshot_observed_at":"2026-07-10T11:37:03.208226Z","title":"Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference","venue":"cs.AR","work_id":"7fa56561-f354-41d2-b5bc-dc36836819a4","year":2025},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2509.09505","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:b948586ab4dfa3557dddb8faefe06f2c81dd26f438987924e4b25ce872cff526","observation_id":"8bd74438-9350-4275-8799-d942ac98399f","resolution":{"observed_at":"2026-06-30T03:04:14.196446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.21548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:16:47.909491Z","title":"Dualpath: Breaking the storage bandwidth bottleneck in agentic llm inference","venue":null,"work_id":"efac15c8-8e58-47be-be0e-c6d13448bfe9","year":2026},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:8c21fd61eeab844fff8e41198acb756ec7bf90646de9251ad1eb9e66dc8ed12e","observation_id":"68e52c3a-1e87-489d-b804-53d02e36f54a","resolution":{"observed_at":"2026-06-30T03:04:14.268305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:13803553501ca5e92cb001eba25296ae23d50657e58fc81ae9743ffe074be1df","observation_id":"72ba9c36-d2ef-4cd3-b4ad-99e46bb75ca7","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:e3529001d4c37c90f659d7e76b41e5750bf58760df33dce9647cfe259cabd39a","observation_id":"744dfe47-89ce-4be2-8d8f-d136776e890b","resolution":{"observed_at":"2026-06-30T03:04:14.241549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:06ba8c7a3100dc11686a8a885d5f8bc39885cca6b2cf5572c2759f296fd41d9b","observation_id":"cd4cdba3-61b5-4074-8bc8-58af2c9433b1","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-07-06T16:21:45.588487Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":"2309.11998","doi":"10.48550/arxiv.2309.11998","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xing, Joseph E","venue":"arXiv (Cornell University)","work_id":"95167dc8-7286-459b-bbaa-1a0b4e9ed5ab","year":2023},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:c383abdecf3a990685ee7640f9b652862730d282aefb72149690aba3bd275de8","observation_id":"81ff348b-798b-41ed-977c-18c2823e3782","resolution":{"observed_at":"2026-06-30T03:04:14.246323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:14d1087ad2d2532c6b4644cc571ebc3a4b424cbf7261779ff5718a3171621768","observation_id":"ab2abf9a-5406-47af-a8cd-c6d589012baf","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:0ed6d23f85acab5dbc23803ec691fef8b6766d70f54feddcebb5ff020d2dbcc0","observation_id":"c3686bac-6a97-44b2-aa8e-c88c48e7e763","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T02:54:11.777615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:c7e3e3d05eb77f1f915bfa033fbe40ce0b5b59535535b009ca3658aaee5ca938","observation_id":"7fb983a1-5fff-4a43-b385-770b646b6d69","resolution":{"observed_at":"2026-06-30T02:54:11.777615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-08-08T01:33:26.740871Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":"2504.02263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-07-11T01:57:51.799355Z","title":"In19th USENIX Symposium on Operating Systems Design and Implementation (OSDI 25), pp","venue":"cs.DC","work_id":"26883f2e-5380-48d4-bfe3-a68b38b39a08","year":2025},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:13a29a835229db98344101aabbf0ee3ae9d11cb9917a00544a330edddd123249","observation_id":"b7a52402-1472-4cb6-9520-55da65adaea6","resolution":{"observed_at":"2026-06-30T03:04:14.249359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":3,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":24,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2606.29207."}