{"as_of":"2026-08-22T22:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a99bf941b864605bc2676039f549c37ea4ea2893fe68f71d0335a8267f184e9","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:57:57.666022Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03555/citation-record","integrity":"/paper/2608.03555/integrity","json":"/paper/2608.03555/citation-record.json","paper":"/paper/2608.03555"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.149323Z","title":"Nvidia h200 sxm 141 gb,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.149323Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:e51779fd132d78f349e38f09cd82668a5a39bbdddc4393ba2453274c3a946d94","observation_id":"8d7dd8e5-e608-48ad-a652-6c400b045177","resolution":{"observed_at":"2026-08-15T14:57:57.149323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.153945Z","title":"TensorRT-LLM,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.153945Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:46846578638e145dfd7d12440312ab610c9fda3982b44b3610fce03d4eebc9d1","observation_id":"d23cb950-4071-4111-9db1-c23f2d3ddbc6","resolution":{"observed_at":"2026-08-15T14:57:57.153945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.160343Z","title":"Lmcache: Turboboosting vllm with 7x faster access to 100x more kv caches,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.160343Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:fd53f05e5eae521d36ecca9a1901e4b51e53985d5e54512ccba14f2608c68069","observation_id":"d994fae3-7ee8-4ec8-b00e-d5c596aeb7bd","resolution":{"observed_at":"2026-08-15T14:57:57.160343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.165570Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.165570Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f8ede5e75e9770ac6ad146ec703616444be6edde301b8cb363ffab8b3aa52f78","observation_id":"daf5a3b2-9e11-4e41-8adf-64eae6a3906f","resolution":{"observed_at":"2026-08-15T14:57:57.165570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.170342Z","title":"Openai models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.170342Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f8cc8e4356a850f9fc0042344150a4ad9419afc5655d2011d0aa278b9fe53e32","observation_id":"50801cb7-55e5-45f7-8934-e0966f654ede","resolution":{"observed_at":"2026-08-15T14:57:57.170342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.175839Z","title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.175839Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:399130ce31531ac565ff3cebc3d4849262027fa57bfd81533650618397aff8ea","observation_id":"05d2b9d8-8946-40c5-b0f0-fabe509eb385","resolution":{"observed_at":"2026-08-15T14:57:57.175839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.180450Z","title":"Claude Opus 5,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.180450Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:2a4480a4be71b18339e89266d56076f150b0873f29217c609e74630faf65f0ce","observation_id":"97c43c0c-55b5-4cba-ac65-1b894d4faa99","resolution":{"observed_at":"2026-08-15T14:57:57.180450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.185398Z","title":"Introducing claude opus 4.6,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.185398Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:4d4c906bccb0aa64d356ee4650682d8abf9f9f1088392bbe7a86f16457de9147","observation_id":"6def015d-e2ff-4748-916b-0361ec8adddd","resolution":{"observed_at":"2026-08-15T14:57:57.185398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.190238Z","title":"Indexcache: Accelerating sparse attention via cross-layer index reuse,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.190238Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:0a32369e6c9014fcb96e598d6f7ac2fb82b9ba0367d969d9bf02c18869577e7f","observation_id":"4d5c634b-397f-411d-b485-69997b07cd7d","resolution":{"observed_at":"2026-08-15T14:57:57.190238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20779","last_updated":"2026-04-22T17:08:19Z","snapshot_observed_at":"2026-08-11T15:00:58.989029Z","submitted_at":"2026-04-22T17:08:19Z","title":"SWE-chat: Coding Agent Interactions From Real Users in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20779","snapshot_observed_at":"2026-08-15T14:57:57.194675Z","title":"Swe-chat: Coding agent interactions from real users in the wild,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.194675Z"},"links":{"cited_paper":"/paper/2604.20779","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:8ae01150339a1d483c6cde2316fdde02944ea1feec7b875421fa88084bcca809","observation_id":"d889abdc-da70-4da1-b7bb-a0f4fc511191","resolution":{"observed_at":"2026-08-15T14:57:57.194675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02922","last_updated":"2026-04-27T10:13:35Z","snapshot_observed_at":"2026-08-15T10:34:21.616923Z","submitted_at":"2025-05-05T18:01:17Z","title":"RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02922","snapshot_observed_at":"2026-08-15T14:57:57.200352Z","title":"Retroinfer: A vector-storage approach for scalable long-context LLM inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.200352Z"},"links":{"cited_paper":"/paper/2505.02922","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:554e41c2f4b96fed208df8fba484bf6ad04521a9c97e091dff5358dcf3976d3d","observation_id":"e795f554-5ee1-49e2-980a-e83d6624a0de","resolution":{"observed_at":"2026-08-15T14:57:57.200352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.205506Z","title":"Magicpig: LSH sampling for efficient LLM generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.205506Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:52829aeea8c0570ed5917bd62b2d94e8bf34f15bf75ed9c389ebe813a7d65d50","observation_id":"9785c5b9-9ee9-42fa-8391-63d5b9581fda","resolution":{"observed_at":"2026-08-15T14:57:57.205506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.210220Z","title":"Llmservingsim: A hw/sw co-simulation infrastructure for llm inference serving at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.210220Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:180d24ab96320afacb4cd76942e48c5dcfda51669aa6bb23c061499b47973a4e","observation_id":"27524ffa-a2f9-4341-8c8b-ed4d34ffd408","resolution":{"observed_at":"2026-08-15T14:57:57.210220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.214380Z","title":"37.3 a 2nm all-digital 14.4gb/s/pin lpddr6 phy with quarter-rate clocking architecture and multi-level fifo-based speculative dfe,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.214380Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:e1255e4395b90021d674da6f159dc65c1207908433b43528375e714366bcb0ee","observation_id":"7fb6dc67-2ed9-4e65-b40a-bb1bd3beef83","resolution":{"observed_at":"2026-08-15T14:57:57.214380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T14:57:57.218841Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.218841Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:4db90e1b3891f72f3e93edcdb89686f83a686cc131936d40585d346e85c3f441","observation_id":"b00c4d4e-a972-48a4-8271-5d7730099d97","resolution":{"observed_at":"2026-08-15T14:57:57.218841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.227132Z","title":"Deepseek-v3.2: Pushing the frontier of open large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.227132Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:33a8f86b87c35d76fb3a98310f4369b96f4adb7de26e605576bdcfe09c9dbfda","observation_id":"c0607bc4-f56d-4fcc-8a80-0e078adbc902","resolution":{"observed_at":"2026-08-15T14:57:57.227132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T14:57:57.232105Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.232105Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:402c6bf1c90968fe9baf56d0f58fce2e966778887c9c84f604f5313460b5331b","observation_id":"41eab178-fbd1-4a7e-aa98-be1626eb6d5e","resolution":{"observed_at":"2026-08-15T14:57:57.232105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-15T14:57:57.236994Z","title":"Swe-bench pro: Can ai agents solve long- horizon software engineering tasks?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.236994Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:5cd133c237db77207502cdc44a505f5c265f454bca5db05822f212a642cb7091","observation_id":"4698871e-9424-4072-8744-99c442d1eaf6","resolution":{"observed_at":"2026-08-15T14:57:57.236994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.242889Z","title":"com/EPIC-RPI/STARC, 2025, accessed: 2026-08-01","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.242889Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:cc77d75cc76a70a6c190ada6c733234f14f25f330a8bd70eabfc3991d6c18891","observation_id":"b9c54e13-78da-4267-8386-4ae5bc89ecfe","resolution":{"observed_at":"2026-08-15T14:57:57.242889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.247307Z","title":"Starc: Selective token access with remapping and clustering for efficient llm decoding on pim systems,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.247307Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:19a7a3a6b5b04573719f2ddd0781f555623097c700144f1ac4cb4ad0d35fefd7","observation_id":"f4c4fff2-a8d7-44ad-81e9-fc3a4fe0344f","resolution":{"observed_at":"2026-08-15T14:57:57.247307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.251826Z","title":"Mtia: First generation silicon targeting meta’s recommendation systems,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.251826Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:802cb8bb9cddfad01d397a20fae7e80a84887e4e91683eb79c59ad50bec8b3df","observation_id":"5d98f96b-0faf-44ae-b8f7-66296dc882d2","resolution":{"observed_at":"2026-08-15T14:57:57.251826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.261315Z","title":"kv-cache-tester: Inference server cache performance test- ing suite,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.261315Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:3bd09288070bcf4f8ede7624c16d0b27e50150bacbe81b6d4a9ef64977590b6c","observation_id":"bc31ffd5-61dd-4a79-9e0d-42d1c00e7906","resolution":{"observed_at":"2026-08-15T14:57:57.261315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.266049Z","title":"Rdma over ethernet for distributed training at meta scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.266049Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:4ff8bf6472519e50bbd367fa97589da142b7616df630b5e931c5788684892416","observation_id":"0c3fe003-8250-4d43-8360-0e285464e383","resolution":{"observed_at":"2026-08-15T14:57:57.266049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.272118Z","title":"Seerattention: Self-distilled attention gating for efficient long-context prefilling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.272118Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:93707d325ec0c2e4ee907b8939042b9064c669b843d203bcfbd3394be90e2db3","observation_id":"b3c33a8c-2718-48b3-b248-4acb9635012f","resolution":{"observed_at":"2026-08-15T14:57:57.272118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.277907Z","title":"Glm-5: from vibe coding to agentic engineering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.277907Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:10480933ccb8933407f77209de1b95f95e59f118d9816a3aec9f3fbf9ca0fec9","observation_id":"dccc7dd2-bd06-474d-97f5-bd388c7914fc","resolution":{"observed_at":"2026-08-15T14:57:57.277907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T14:57:57.290966Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.290966Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:8c48eb3d6b70813fa88267f913a4c2a0a4b5b51f5f59375e4252739ec0780839","observation_id":"5a398715-204c-44e4-bc15-693948fe7d10","resolution":{"observed_at":"2026-08-15T14:57:57.290966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.297214Z","title":"Pim is all you need: A cxl-enabled gpu-free system for large language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.297214Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:40ad7f3a5a648ec31e1a00196c1fe178173ad21a1f6411ea8510e22f1bcd2eaf","observation_id":"eb81e072-00eb-482a-a58b-409c75c5b507","resolution":{"observed_at":"2026-08-15T14:57:57.297214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.307638Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.307638Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:5ee1a85c71671364b31991d9cfbe95763c00fd5406afba5f5dc1f9060936182e","observation_id":"e4511efe-4c01-4c32-b566-97888a99794f","resolution":{"observed_at":"2026-08-15T14:57:57.307638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.312140Z","title":"Shyla: 3d-stacked nvm-dram hybrid llm-inference ar- chitecture exploiting data and memory heterogeneity,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.312140Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:bd577d6f139ab024271d1e0b123d28a7162b995adabf401b1df76442ae5d2b2f","observation_id":"7554c8b6-9059-4353-9e6f-0eecee72c60e","resolution":{"observed_at":"2026-08-15T14:57:57.312140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.322232Z","title":"Transparent offloading and mapping (tom): enabling programmer-transparent near-data processing in gpu systems,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.322232Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:bb98f37a3adc6c05e59209dd42bb2c1612b458674395c6ffb8565e4e4765c8fe","observation_id":"0606b9f1-2d6e-4b29-bccd-e19b59a675d8","resolution":{"observed_at":"2026-08-15T14:57:57.322232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.327773Z","title":"Hybridspec: Exploiting hybrid-bonding memory to accelerate llm serving through heterogeneous architecture and specu- lative decoding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.327773Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:b64b6759a99f3cb4a8c908539b871f0edea2bbeddf8d37f128b44b8fbfe842aa","observation_id":"92794a87-85ac-4989-aae7-21eccd6726f9","resolution":{"observed_at":"2026-08-15T14:57:57.327773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.400453Z","title":"codex_swebenchpro_traces,","venue":null,"work_id":"22ef863e-59b9-46b4-b245-8c1551141b38","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.332368Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:ed4b53dd3954fd81f6ee2e28e9102243a53e4e28fa231d74110c39bf7a75a0cd","observation_id":"65ce5f7e-a2de-4057-a3af-d8051eeb72cb","resolution":{"observed_at":"2026-08-15T14:58:00.405442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.337036Z","title":"A cost-effective near-storage processing solution for offline inference of long-context llms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.337036Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:b094f3a04dacddd4667af7c7b934742aa397d4cff1a8997dec5e4066693f9b3b","observation_id":"ff04b0c3-e21d-481b-bce7-1aeceec7758c","resolution":{"observed_at":"2026-08-15T14:57:57.337036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.383982Z","title":"2023, standard","venue":null,"work_id":"18d6392e-88fc-4344-a13a-5d70b2bc1d0c","year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.342985Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:a2c9678d87a486078f60858d705e5b7bba2bed5615d00d27b30f5999723351a2","observation_id":"4357d5ee-87d6-4671-bd19-378565f75dbc","resolution":{"observed_at":"2026-08-15T14:58:00.388832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.368269Z","title":"Scalable processing-near-memory for 1m-token llm inference: Cxl-enabled kv-cache management beyond gpu limits,","venue":null,"work_id":"5f59d74e-da7f-4e88-93fb-8c81ab6f2b23","year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.347564Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:c2299edefaee7aac09652be9ac8dc41010d4135839002614625c3763ed8cd317","observation_id":"292a8f94-8850-42e8-abe0-a5218dc819a0","resolution":{"observed_at":"2026-08-15T14:58:00.373609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.351827Z","title":"Toward standardized near-data processing with unrestricted data placement for gpus,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.351827Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f38df7d072312434783cf64fba571b353303f0543c0aa55a93da1dbcd77a6539","observation_id":"27e6b1ca-3cef-41fc-802e-ed0b75920cb8","resolution":{"observed_at":"2026-08-15T14:57:57.351827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.352224Z","title":"Samsung pim/pnm for transfmer based ai : Energy efficiency on pim/pnm cluster,","venue":null,"work_id":"63eae3d3-df00-4e71-a5ca-d336cadd8419","year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.361114Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:57fcf12d34bfdc7905618f5edbeeb5ab029b14c16c748bed24f606c00e718baf","observation_id":"bdb24d7b-fb77-4ad6-bc34-c67397c21fca","resolution":{"observed_at":"2026-08-15T14:58:00.357756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.337369Z","title":"A silicon-proven unified low-latency CXL controller and port-based routing switch for memory-centric fabrics,","venue":null,"work_id":"238e284d-a013-4d1c-9b1f-c922179f8e21","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.365715Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:233f57c703f559efde13c8596f2b4aac239ccf4ef52d980be86b9004c60978a8","observation_id":"3455db69-509a-4875-bd3a-7c51965ffa3f","resolution":{"observed_at":"2026-08-15T14:58:00.342205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.370496Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.370496Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:5115c41d15edb09ce50a065545a0c913d999f6f775656571f1560b5f14806bb5","observation_id":"465ec14d-4bfc-402e-8413-0ec92401e7ef","resolution":{"observed_at":"2026-08-15T14:57:57.370496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-13T11:59:50.629136Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13392","snapshot_observed_at":"2026-08-15T14:57:57.375091Z","title":"Minimax sparse attention,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.375091Z"},"links":{"cited_paper":"/paper/2606.13392","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f465f5a20465880eda958820a7ca0cc6aae26f3acf69c0b5f43150434960c754","observation_id":"00f128ec-72ba-4720-aa6a-5f82733ceee4","resolution":{"observed_at":"2026-08-15T14:57:57.375091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.380038Z","title":"Hardware architecture and software stack for pim based on commercial dram technology,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.380038Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:e6f7f2da584211eb948d239b5043258f0b6b5f69dae19094f2818e124e83f73f","observation_id":"b6655629-ac27-42ea-94e6-43883d1bb4c8","resolution":{"observed_at":"2026-08-15T14:57:57.380038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.384812Z","title":"Pond: Cxl-based memory pooling systems for cloud platforms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.384812Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:72f617545bbe325a63180bd380957c7af6f278058c8f2e02e66e7816d377b985","observation_id":"a83c82e6-8200-4657-bce0-f1358b096d23","resolution":{"observed_at":"2026-08-15T14:57:57.384812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.322243Z","title":"Snapkv: Llm knows what you are looking for before generation,","venue":null,"work_id":"3957f23c-ded9-425b-9df2-353295499609","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.389331Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:1caba695990a48fd278753aecdbbb9492e2438b76bf4476f82d7013e4a6440d5","observation_id":"7f38912b-813f-451a-9ab3-85f17b37e38b","resolution":{"observed_at":"2026-08-15T14:58:00.327089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.307111Z","title":"Meridian: In-memory acceleration for rag with document attention decomposition,","venue":null,"work_id":"43e646bb-9d39-44cf-87e6-a6ad2346ffa6","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.393819Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:407298362942522f4dc50c01c94a5fb2e98928db4ce555b71ef99be734a3e931","observation_id":"7f6498db-72a4-45f6-90a3-f75c2a6c6dfb","resolution":{"observed_at":"2026-08-15T14:58:00.311907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.291813Z","title":"Chime: A case for efficient long-context attention- fc disaggregated inference with dimm-pim,","venue":null,"work_id":"78966f43-84a4-4249-9505-c16fe88223af","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.398419Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:5fd174cd7ddfd6bd300fa92154719a5b398f2267db3b2a4353501e198f028ad5","observation_id":"71aad5d4-c91f-49c2-858b-41b4ce41751c","resolution":{"observed_at":"2026-08-15T14:58:00.296688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.276944Z","title":"Nvidia’s ad102 officially revealed, how close were the previ- ous estimates?","venue":null,"work_id":"3b2ead36-0c29-4ef0-9de0-1b39ec330775","year":2022},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.403138Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f090ae4c3f741464394e0ab4fa3a7ba33aae17e44714418f5b3d3887f7a53197","observation_id":"869f7343-2506-4a36-b35b-e6b316f3042e","resolution":{"observed_at":"2026-08-15T14:58:00.281663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.260007Z","title":"MoBA: Mixture of block attention for long- context LLMs,","venue":null,"work_id":"26870a04-0533-47bc-b7ad-d85b43e7cf8e","year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.407621Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:4e8654b71e76e877a850dcb77f204205b8658b81c125890cfc838b3254da067e","observation_id":"829d515a-1328-484d-a2a7-e0dfb5104868","resolution":{"observed_at":"2026-08-15T14:58:00.266183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.243911Z","title":"Sac: Disaggregated kv cache system for sparse attention llms with cxl,","venue":null,"work_id":"33eaf7d3-c07d-4221-8c55-bca2eae8a2e0","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.412221Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f2148748fa772c25228c70fec75adbe84820d3f8eb90757c32342a30514d0460","observation_id":"4b1472e6-8049-4b9b-a3fd-0d908548c702","resolution":{"observed_at":"2026-08-15T14:58:00.249064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.416938Z","title":"Tpp: Transparent page placement for cxl-enabled tiered-memory,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.416938Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:a956f52ff05e6902bfee58b6ab77f8d86481f8c0ab95ba7e72e63f8badb1e929","observation_id":"f4247f77-a36b-4cbb-bf91-6c1dde323abc","resolution":{"observed_at":"2026-08-15T14:57:57.416938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.224894Z","title":"HBM3E product brief,","venue":null,"work_id":"bc5db998-93f8-40b8-bd40-c49d72154533","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.421441Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:8df5f9a13d0a3b0f17d8f9d4575a653124cccd9fa52908307447f08c4822a31c","observation_id":"64f75a88-0540-4e21-9f37-6939e5b7260f","resolution":{"observed_at":"2026-08-15T14:58:00.230476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.208395Z","title":"g ed., May 2025, production Data Sheet","venue":null,"work_id":"fa3bce1a-ad2e-4d4a-bfa7-ed57d1298bd7","year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.426206Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:8544d9a43787f1710360e58329be546a19a10f80eb3027b598a6c428bb6eb374","observation_id":"7c1242cb-69e5-425b-9301-cc03127b2e7c","resolution":{"observed_at":"2026-08-15T14:58:00.214140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.191137Z","title":"Early silicon of raptor: The first 3d-dram accelerator for generative inference,","venue":null,"work_id":"fbb67968-d72d-4940-9697-ae7327752371","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.435190Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:18c31ef413ca73066a8bc033cb4e7a341bb51b990dd9e0496ca5ac9556568547","observation_id":"7e09f9a6-ee34-4308-aa07-d9b8b4f6cbd2","resolution":{"observed_at":"2026-08-15T14:58:00.196710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.172522Z","title":"NVIDIA DGX B200 datasheet,","venue":null,"work_id":"f510638b-02f5-4bc6-a3b4-30062714cd0a","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.440118Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:67c43f979ed11d3c2520c971d240ebe72dd0c50d4aa4066beda80e3523ef5d99","observation_id":"9836d34e-ce16-4ebf-89ad-ae9c2ff349d2","resolution":{"observed_at":"2026-08-15T14:58:00.177834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.149744Z","title":"NVIDIA DGX H200 datasheet,","venue":null,"work_id":"a0e56799-dba8-415a-91f9-821b43933707","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.444590Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:821a35ec7f2c08a3bbd5af0fd24130e78ecca457bfca34dff95a3d3d22b97e29","observation_id":"1e5d862b-f97e-4795-b713-89da268bb6e0","resolution":{"observed_at":"2026-08-15T14:58:00.155632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.127805Z","title":"SLA-based planner,","venue":null,"work_id":"7025d8e4-9f36-4760-b71e-6ddb3a560a83","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.449134Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:e65657b67bb784c4dc970b27ad4770e8740496bbb6f36cd6aed4e410d78c5654","observation_id":"bc8a10d5-e6e6-443c-b7bc-1192e7f07541","resolution":{"observed_at":"2026-08-15T14:58:00.133856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.108628Z","title":"Multi-process service: Appendix: Tools and in- terface reference,","venue":null,"work_id":"1b0546c2-810c-4de1-bb38-ed6ad50ed719","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.453507Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:14a894e3ad82a2f3c3deb0b158e5a1f1b2e137304f29274c76a0911f5278a312","observation_id":"40a02988-eb34-4758-ae43-b55623d62339","resolution":{"observed_at":"2026-08-15T14:58:00.114628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.091081Z","title":"(2026) Overall architecture — NVIDIA Dynamo documentation","venue":null,"work_id":"8ffd549f-5511-452e-8feb-a9200e454f23","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.457817Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:5b58d0e62e7c375705afac357c288ea2c73dc9abd272ad2e0c92dcd651946324","observation_id":"91f4f66e-9c28-4902-9863-85885036bb75","resolution":{"observed_at":"2026-08-15T14:58:00.096891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.072685Z","title":"Planner design,","venue":null,"work_id":"eb563695-e216-4410-9f35-fc9c51e74f75","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.462454Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:b5d37c54e9293c3c02393ecf7cea6ad2360fb428e070d732f89b2bce9e9627b5","observation_id":"28c3453f-11da-4719-85fc-e20312900b88","resolution":{"observed_at":"2026-08-15T14:58:00.078680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.045853Z","title":"Supported MIG profiles — NVIDIA multi- instance GPU user guide,","venue":null,"work_id":"9e82f370-0155-442e-bdd3-21df5d3b667d","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.466901Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:8cb386425fbad4fc7381f6e854007e7c1ee1ecc816c18dc047e60a97ed306248","observation_id":"d2f30c89-eb67-4ec1-9181-69f50c4b9246","resolution":{"observed_at":"2026-08-15T14:58:00.057883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.471604Z","title":"Fine-grained dram: energy-efficient dram for extreme bandwidth systems,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.471604Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:376a23173a60c63a540eb29957fa39f3e853c51904e8d2491fbd1ebf582a48e6","observation_id":"0a47aa5c-f6f7-4039-821b-fa75e4d27b88","resolution":{"observed_at":"2026-08-15T14:57:57.471604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.476730Z","title":"Exegpt: Constraint-aware resource scheduling for llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.476730Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:b1ea401da58d6e6aff0c33f84495248e57ba62a716a8ec5eac554afb599ce8f3","observation_id":"99c0a576-0a4e-4b7c-ba8f-b01174e431c9","resolution":{"observed_at":"2026-08-15T14:57:57.476730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:58:00.000105Z","title":"ChatGPT (GPT-5),","venue":null,"work_id":"575ef7a3-0cbb-4553-bef0-385a32506300","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.481464Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:b7f97312933e89d670d762eff63ead068d6a7890c50c8277b1fc8693a828b75f","observation_id":"1e245943-ff76-4cb3-a140-40ef552e5bfe","resolution":{"observed_at":"2026-08-15T14:58:00.013479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.490666Z","title":"Attacc! unleashing the power of pim for batched transformer-based generative model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.490666Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f63baef296e6ec8dca828664d2a29fd22234b94d73a88b6a74f8fbd4f8ffc304","observation_id":"ace60453-3340-4802-81d5-92b0b982d7e2","resolution":{"observed_at":"2026-08-15T14:57:57.490666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.981282Z","title":"A 192-gb 12-high 896-gb/s hbm3 dram with a tsv auto-calibration scheme and machine-learning-based layout opti- mization,","venue":null,"work_id":"d09ec84e-d436-45f7-984f-04b809ad9fff","year":2022},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.495167Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:874ce1520c3936d0a40d523e8cf3eaa50069913dc4aba4f956a992e7f51d17fc","observation_id":"4be5218b-1826-48f2-908a-3323625201bd","resolution":{"observed_at":"2026-08-15T14:57:59.987872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.500163Z","title":"An lpddr-based cxl-pnm platform for tco- efficient inference of transformer-based large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.500163Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:8a37f32111d4d646ea72813d93a9430f66817146f65361c5b6ec41c03977aec4","observation_id":"3bfbb05d-b684-4ff6-8cb7-ac3d9e0cfbc4","resolution":{"observed_at":"2026-08-15T14:57:57.500163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.963389Z","title":"Apple m2 die shot and architecture analysis – big cost increase and a15 based ip,","venue":null,"work_id":"344ecfa6-7a65-4634-9daa-ed4d047be468","year":2022},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.504641Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:9091adec6d71bb707fb09cc26293c113c75d9d86781f2ec07ead8bc474e644ff","observation_id":"1341262d-1f59-4dc4-b3de-789a5a15811a","resolution":{"observed_at":"2026-08-15T14:57:59.969080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.509113Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.509113Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:45b74b87d4a12e1678528dd9b63b7f80c515704195ed19c644500566d6539c3a","observation_id":"38d07b6e-9fa6-4c2c-a51e-0ade696dcac8","resolution":{"observed_at":"2026-08-15T14:57:57.509113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.513839Z","title":"Mooncake: A kvcache-centric disaggregated architecture for llm serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.513839Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:b9e3778f1b91321e9d692f718a251ff9cf2a201183443729d802dd749a2e3f57","observation_id":"4eaec88c-7719-437a-afd7-fd967a84a59f","resolution":{"observed_at":"2026-08-15T14:57:57.513839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08509","last_updated":"2024-11-25T17:35:07Z","snapshot_observed_at":"2026-08-19T00:38:58.889292Z","submitted_at":"2024-04-12T14:46:15Z","title":"Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08509","snapshot_observed_at":"2026-08-15T14:57:57.518164Z","title":"Efficient interactive LLM serving with proxy model-based sequence length prediction,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.518164Z"},"links":{"cited_paper":"/paper/2404.08509","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:34c3c2cb6b817f93ce5f17d659c210fe3d6fc12756c06cf934b73caba9d22199","observation_id":"be2c78d2-20ee-4db1-91b9-59affbe87787","resolution":{"observed_at":"2026-08-15T14:57:57.518164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.527863Z","title":"Longsight: Compute-enabled memory to accelerate large-context llms via sparse attention,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.527863Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:c913bec20e0b93394c610f5b87f64fd7eaaf06dd24ca1b9350701dcf406a91ad","observation_id":"d4717908-7610-4d28-b5b2-78b1b4a751c9","resolution":{"observed_at":"2026-08-15T14:57:57.527863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.532714Z","title":"Drex: Accurate and scalable dense retrieval acceleration via algorithmic-hardware codesign,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.532714Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:4909d39f42a55411fd4f6856ac327c6ea42e120be7b85959a548556aeb58a027","observation_id":"0f44faa9-2424-42e0-b960-19ece375ed0d","resolution":{"observed_at":"2026-08-15T14:57:57.532714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.945408Z","title":"Sparq attention: bandwidth-efficient llm inference,","venue":null,"work_id":"94012afc-067c-4be6-80b2-5e03cb01efe2","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.537246Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:facf3719455188ad946a8d1386e648177684d318a058cfa20fe91cbdb107045a","observation_id":"25ac2814-db2d-45f2-8542-7c5d76ec5873","resolution":{"observed_at":"2026-08-15T14:57:59.951661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.928223Z","title":"AttAcc simulator,","venue":null,"work_id":"5ab948d1-d40a-454b-a7da-ba764de17eea","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.541691Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:7582306260cc587bcadfa5345bf8d3f6c6d72c2145c803952339d336f08e7564","observation_id":"ecf9d468-0bbf-4022-b109-7beef9a8a122","resolution":{"observed_at":"2026-08-15T14:57:59.933904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.910056Z","title":"LLMSimulator,","venue":null,"work_id":"f64de15b-0f13-4da0-b2ac-b511fd83b5e0","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.547009Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:4c869653f097d4e0372be42196d6afe72ec5913cbc6e361b0444fcd1436efabb","observation_id":"4abada64-ac32-424b-9d45-198da8bbcdc5","resolution":{"observed_at":"2026-08-15T14:57:59.915842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.890116Z","title":"Toolformer: Language models can teach themselves to use tools,","venue":null,"work_id":"bf2e3cc4-64cc-41c5-b223-6bb80ccc23fb","year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.553027Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f7ef6e35d8207fe3733a14c5013ca449df448f5aa155d6e554635e6eb9228bca","observation_id":"9bdce448-1a96-4225-ae22-eda8614c7bd6","resolution":{"observed_at":"2026-08-15T14:57:59.896406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.561610Z","title":"Ianus: Integrated accelerator based on npu-pim unified memory system,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.561610Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:b89f46c729ea36e8b09d25e46df78dd7209bb97c99e08f4b344973529ed2ab9d","observation_id":"78165bad-bf47-4527-a14a-fc563f2e7431","resolution":{"observed_at":"2026-08-15T14:57:57.561610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.567291Z","title":"Dynamollm: Designing llm inference clusters for performance and energy efficiency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.567291Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:9a06d6c3d8a7180b620ff172f81de08e13feec5161a65beb0ac992f9511e4d23","observation_id":"218598e1-5126-43d3-8251-a7b889123e80","resolution":{"observed_at":"2026-08-15T14:57:57.567291Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.871187Z","title":"Quest: query-aware sparsity for efficient long-context llm inference,","venue":null,"work_id":"aa0e1e44-2620-46c0-a486-e169ad1793db","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.572723Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:7b7f4001553a6e4405315c166235a8563adc9643928b7d896250833839c92b46","observation_id":"da7ae6ab-79c6-4dbb-a06e-cce59b3194c7","resolution":{"observed_at":"2026-08-15T14:57:59.877514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.852720Z","title":"Astra-sim2.0: Modeling hierarchical networks and disaggregated systems for large-model training at scale,","venue":null,"work_id":"4fe72e03-06dd-46a0-b792-a12ce01de4b7","year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.578688Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:75c4b83091e92d9f98e2fcba6598cffb82201c04c3e2e11b5b82c845533aaad3","observation_id":"667ab8f0-9d40-440b-b974-95062c1b1d3e","resolution":{"observed_at":"2026-08-15T14:57:59.859074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16007","last_updated":"2026-04-17T12:29:54Z","snapshot_observed_at":"2026-08-12T12:35:43.936992Z","submitted_at":"2026-04-17T12:29:54Z","title":"MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16007","snapshot_observed_at":"2026-08-15T14:57:57.583167Z","title":"Memexplorer: Navigating the heterogeneous memory design space for agentic inference npus,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.583167Z"},"links":{"cited_paper":"/paper/2604.16007","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:df6330dcb6f5e06c4ea4964ac77a30a4412b29b81dc2804800014e299aad77ec","observation_id":"839c0458-9fd5-4f3c-a139-8460017ad2ea","resolution":{"observed_at":"2026-08-15T14:57:57.583167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.827670Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":"d4094973-3180-4695-a163-03b57e0da5ee","year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.588354Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:e5ccd9bf4b0b9a42f58b6901095e4d4f5ab264634bc683d4c21c885719ea4332","observation_id":"e503753f-a17d-4fc5-8d8e-ab0748aa2ea3","resolution":{"observed_at":"2026-08-15T14:57:59.840387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.811963Z","title":"Hisparse: Turbocharging sparse attention with hierarchical memory,","venue":null,"work_id":"37269ba2-a9f5-4b18-83b3-5fe46de2b26e","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.593155Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:32611b083e9044cc746347a7caa6c0369f04d41f03e23f55592fa063fca2fb80","observation_id":"548abcf4-5487-455f-8d76-53761d9825d2","resolution":{"observed_at":"2026-08-15T14:57:59.817534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18572","last_updated":"2025-08-26T00:09:03Z","snapshot_observed_at":"2026-08-18T12:35:51.096042Z","submitted_at":"2025-08-26T00:09:03Z","title":"Strata: Hierarchical Context Caching for Long Context Language Model Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18572","snapshot_observed_at":"2026-08-15T14:57:57.598073Z","title":"Strata: Hierarchical context caching for long context language model serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.598073Z"},"links":{"cited_paper":"/paper/2508.18572","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:f0a909bcd192388caf388451e643a70d89a4effcb1aaf001b10069319fa0000d","observation_id":"06aa777f-2162-43e5-90a6-415a16325328","resolution":{"observed_at":"2026-08-15T14:57:57.598073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3786627","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.718574Z","title":"Beluga: A cxl-based memory architecture for scalable and efficient llm kvcache management,","venue":null,"work_id":"2ffac337-e05d-406a-b81d-09a0000965c7","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.613579Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:8b9228a446a000e23572ba0c0414f6a2c81c8fc9704465cdbfba04495ec35f59","observation_id":"61352f64-28ee-4604-9d51-645e6cc9726d","resolution":{"observed_at":"2026-08-15T14:57:57.723542Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.793872Z","title":"ReAct: Synergizing reasoning and acting in language models,","venue":null,"work_id":"7f9a91db-087c-4680-a14a-bcc613a5bbb9","year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.618785Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:148c5d90e5363589ca596afe9b0a8409bd94d8ddfbba25eef8bd76d3d89433df","observation_id":"5a859f43-3852-4bb0-b0a9-ed6b4028d22d","resolution":{"observed_at":"2026-08-15T14:57:59.799077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.623910Z","title":"Tract: Disaggregated llm serving with cxl shared memory kv cache at rack-scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.623910Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:d649d13069597f6bf563b017fc5fd035fefc632c92d251cb45fc007703b71ec1","observation_id":"850db07b-93a5-45a3-9604-7db34f945c25","resolution":{"observed_at":"2026-08-15T14:57:57.623910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.608756Z","title":"Available: https://arxiv.org/abs/2601.06288","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.608756Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:e227da22bb7632e15d818892d6df572dd8ba1f61430d2de2ea09c74f93a528bf","observation_id":"2a5ed225-56ef-45e6-8cbb-da43b1be8389","resolution":{"observed_at":"2026-08-15T14:57:57.608756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.634586Z","title":"Duplex: A device for large language models with mixture of experts, grouped query attention, and continuous batching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.634586Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:a1a75acd6f4f8cfe2f52c5c9f25e2efa216232f9f4c998fc543d7aaddb366a09","observation_id":"1737c7af-5fd7-4fad-b374-3efcad806983","resolution":{"observed_at":"2026-08-15T14:57:57.634586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.760920Z","title":"H2o: heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":"7a17b577-9fa8-489a-ac6a-2b9efa8488fb","year":2023},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.639094Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:4f5617c55a610aa5a8c7327563010f0201fa860a360fc26a5ee993b91793ac44","observation_id":"e1732f4f-713b-41b3-a128-263a10bb69cd","resolution":{"observed_at":"2026-08-15T14:57:59.766301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.744010Z","title":"Deepep: an efficient expert-parallel communication library,","venue":null,"work_id":"60f3247c-bc82-4539-9396-b715814f8868","year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.644038Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:879cb80537bfe18b0ba1371579d6ea30097e2eacd537ef54a1b41d5292aabafc","observation_id":"71d4a0a6-e8ec-4b87-a3d9-5714e972d590","resolution":{"observed_at":"2026-08-15T14:57:59.749108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.777436Z","title":"Patterns behind chaos: Forecasting data movement for efficient large-scale moe llm inference,","venue":null,"work_id":"96fdf0e8-0990-4d19-bfaf-959b4ed648c8","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.628881Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:ee979e0522ebb3c1170b27042c0cff27193e83bb18d54158d44e2750c42dca36","observation_id":"d5be8cc2-997c-4877-83ef-d897fb643fe6","resolution":{"observed_at":"2026-08-15T14:57:59.782718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.708734Z","title":"Sglang: efficient execution of structured language model programs,","venue":null,"work_id":"ceecb120-1b26-4641-a115-e52980dfb000","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.653026Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:24556d4e6855d7668a91898aaf839eebcfbb49464345f7952cd1afd262e29b87","observation_id":"41ca0024-80fe-42d2-b55e-9edb60e1fb5b","resolution":{"observed_at":"2026-08-15T14:57:59.715187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.689963Z","title":"Distserve: disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"1510b840-5337-40fc-aa44-91d86367aa6d","year":2024},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.657267Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:555a73faed721df53d99777f1cd97aa3dc0e16a2240900338894b1eb711b458d","observation_id":"3907fcb6-17cb-48ca-8e76-7207edf8feee","resolution":{"observed_at":"2026-08-15T14:57:59.695869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.671854Z","title":"Octopus: Enhancing CXL memory pods via sparse topology,","venue":null,"work_id":"df00845e-74a6-41c2-b3bc-145c43305506","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.661606Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:332c380a048e674d1409f960916a6b2490b4c040b63bf21d514232df069479d7","observation_id":"e239bc84-b2d3-4b0d-ae2d-c14ff1bd4364","resolution":{"observed_at":"2026-08-15T14:57:59.678165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:59.726075Z","title":"InfLLM-v2: Dense-sparse switchable attention for seamless short-to-long adaptation,","venue":null,"work_id":"06404167-ce4c-483d-a0e0-b5784b3e44be","year":2026},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.648545Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:3d96f8aa8b2154d83c5c61fb1d47086e38fcd8f24415cbf7c5ce96d368757725","observation_id":"0c47f604-1cf0-4652-8f5f-2db614f4fe2f","resolution":{"observed_at":"2026-08-15T14:57:59.732854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3718958","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.700305Z","title":"Megascale-infer: Efficient mixture-of-experts model serving with disaggregated expert parallelism,","venue":null,"work_id":"b64362ed-c98f-4338-adec-20350d5d4d94","year":2025},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.666022Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:5d4ab228040925af18783ca9623e727d421a9cd54cda2934a35e6b8bb4a6f207","observation_id":"8e9f74b2-3a44-4952-8547-279579b2989a","resolution":{"observed_at":"2026-08-15T14:57:57.707092Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:57.256627Z","title":"Available: https://doi.org/10.1145/3579371.3589348","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.256627Z"},"links":{"citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:98dec504d281f4a752c795232a5f18996453ed3b984afb1bbc576576e4293380","observation_id":"f2a2bbea-f4d4-4576-85e9-cffcebd4f8ee","resolution":{"observed_at":"2026-08-15T14:57:57.256627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08509","last_updated":"2024-11-25T17:35:07Z","snapshot_observed_at":"2026-08-19T00:38:58.889292Z","submitted_at":"2024-04-12T14:46:15Z","title":"Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08509","snapshot_observed_at":"2026-08-15T14:57:57.523025Z","title":"Available: https://doi.org/10.48550/arXiv.2404.08509","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.523025Z"},"links":{"cited_paper":"/paper/2404.08509","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:d2ba4d92f89560d2929bb26a941199e3536f64e2c3c3f271a111af2d2f80e9c6","observation_id":"278d6a21-d664-440c-900d-9e99ab57a0c5","resolution":{"observed_at":"2026-08-15T14:57:57.523025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-15T14:57:57.283172Z","title":"Available: https://arxiv.org/abs/2602.15763","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:57.283172Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2608.03555"},"observation_digest":"sha256:735ee9275aca432d03cfdf77715ebd8c1b36faf7d9100eed9abb39cd4c33cd8f","observation_id":"577d7638-0e16-430e-a748-bf2dae12ae21","resolution":{"observed_at":"2026-08-15T14:57:57.283172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03555","last_updated":"2026-08-04T12:25:45Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-19T01:15:55.357267Z","submitted_at":"2026-08-04T12:25:45Z","title":"Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":40},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2608.03555."}