{"as_of":"2026-08-10T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:825b39166b320d9eae299f3a093cffc9634478d137418060ed6d81e24d3a0762","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:49:27.634595Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01891/citation-record","integrity":"/paper/2608.01891/integrity","json":"/paper/2608.01891/citation-record.json","paper":"/paper/2608.01891"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:21.396967Z","title":"Taming Throughput-Latency tradeoff in LLM inference with Sarathi-Serve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:21.396967Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:0854d0bcec9c0eafebea701caf3afa64282a4f443a65ecec61eca499c4018edf","observation_id":"c8b61952-edf6-419b-8c18-0766b3e15927","resolution":{"observed_at":"2026-08-04T18:49:21.396967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-04T18:49:21.474198Z","title":"SARATHI: Efficient LLM inference by piggybacking decodes with chunked prefills,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:21.474198Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:6bd6d0b96409e5eee5ba285db4c29781497ecc73b0a27b110a709eb0472de23a","observation_id":"6f6ae754-fee4-4a2b-a942-2cc2210b866c","resolution":{"observed_at":"2026-08-04T18:49:21.474198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:21.548021Z","title":"Azure Public Dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:21.548021Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:859d878f0bf453a3338178989cdcbd088c832e8ad751a68d85e8dad7052a930b","observation_id":"5146295f-fdc9-4792-9e52-37b510fcd8fe","resolution":{"observed_at":"2026-08-04T18:49:21.548021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:21.681782Z","title":"Biscale: Energy-efficient disaggregated llm serving via phase-aware placement and dvfs,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:21.681782Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:2bc07700e2b6c645d1cc69b8a73ee698049d907d87818d2c8a7ea259d772af72","observation_id":"a0f222f9-27ed-4bad-b2e1-8f9b7fd4991a","resolution":{"observed_at":"2026-08-04T18:49:21.681782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:21.836600Z","title":"Reducing the carbon impact of generative ai inference (today and in 2035),","venue":null,"work_id":null,"year":2035},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:21.836600Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:d5abee7abc0177e9f7b673700623e5b07c6e6f3eae258d4057dc33bf1cd0f1ce","observation_id":"dd8891bc-fa31-4f8a-9b9d-e67073499dcd","resolution":{"observed_at":"2026-08-04T18:49:21.836600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:21.970638Z","title":"Copilot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:21.970638Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:96fedca3aa8f2fff33a42716c8f97c0ea930a66d5d70d7586eabd9cc41afa59a","observation_id":"21e9e55b-1e0a-40e3-8c73-ad1defc5eff3","resolution":{"observed_at":"2026-08-04T18:49:21.970638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:22.121170Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:22.121170Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:a16970a3e0aab3781f4bd7975f8cb3d71329da1a5c1d0c66299c6db4749fdbef","observation_id":"7adb02b2-d8de-4fd5-82cc-15ff0deabe3f","resolution":{"observed_at":"2026-08-04T18:49:22.121170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:22.256771Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:22.256771Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:f67d8f9b136d079dcc5b8ae23812b90116bc9ab28a43a06e27883c01a70561b3","observation_id":"1a4e0ba6-d21e-4b69-8d7d-915c9b3fcfe3","resolution":{"observed_at":"2026-08-04T18:49:22.256771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:22.399419Z","title":"Context Caching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:22.399419Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:1ca15b5461d7e03c4190ada0b5740617ac7609445ec217f56f5445ecceb2a8e4","observation_id":"b169a158-7018-48c4-90a4-f1e0e3fbd971","resolution":{"observed_at":"2026-08-04T18:49:22.399419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-08-10T11:43:00.160557Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-08-04T18:49:22.543190Z","title":"Flashdecoding++: Faster large language model inference on gpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:22.543190Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:4eb0f4895003120bc34758a7ae511e021a6d9b4c5a89ec13a834705035220244","observation_id":"f9d0b40c-a746-425d-a2eb-54a225b0ff58","resolution":{"observed_at":"2026-08-04T18:49:22.543190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:22.686898Z","title":"Smoothoperator: Reducing power fragmentation and improving power utilization in large-scale dat- acenters,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:22.686898Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:a206a661c64afd0aebc484d1970baff648e3c3521ac70519a787b33377db9799","observation_id":"c08e005f-87c2-4338-99d1-66eec8b4dc53","resolution":{"observed_at":"2026-08-04T18:49:22.686898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-08-10T13:50:07.719544Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-08-04T18:49:22.840559Z","title":"Memserve: Context caching for disaggregated llm serving with elastic memory pool,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:22.840559Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:1198c68155b7ed1e09423b669740a02e16d3fd8bf19c566625b2b45c8fad23f6","observation_id":"2b17282e-2cbb-4913-896d-4eaa09d08b5c","resolution":{"observed_at":"2026-08-04T18:49:22.840559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-04T18:49:22.951059Z","title":"Inference without interference: Disaggre- gate llm inference for mixed downstream workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:22.951059Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:bbd105747f79fe80dab13e1c2ab899a4e09d752ebe15b647a534128b5e399a5a","observation_id":"7d2fc877-c3e9-4a5b-9681-8eb28e071b5f","resolution":{"observed_at":"2026-08-04T18:49:22.951059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:23.116685Z","title":"throttll’em: Predictive gpu throttling for energy efficient llm inference serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:23.116685Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:ec1ad2e2c9f6f9b0de450a0a1069715c298ff5fa31f86e6f2e9ee07f924a01ce","observation_id":"457c84e7-5678-48f6-a755-cebf572dc9d2","resolution":{"observed_at":"2026-08-04T18:49:23.116685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:23.291029Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:23.291029Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:3fdcf7da2a2e3e81c7fd4d8ef8b8ffbbe54909806e388618a14f008fcf450ca9","observation_id":"53e7ff0c-8bea-4d4e-9641-10d6b95e32f0","resolution":{"observed_at":"2026-08-04T18:49:23.291029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:23.545949Z","title":"Greenllm: Slo-aware dynamic frequency scaling for energy-efficient llm serving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:23.545949Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:706ad8b18d9bdd81912f08d62e92e268e9e4469197b5197d81ee810ab6f94c4c","observation_id":"f7303883-8393-45f5-a34f-296637f6ce26","resolution":{"observed_at":"2026-08-04T18:49:23.545949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:23.710023Z","title":"Lmcache: An efficient kv cache layer for enterprise-scale llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:23.710023Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:e23422c79df0060b2ed32c56411584b239dcf6cdd9551a35d6a51a7f7de6205a","observation_id":"794e38b3-7266-455a-84f7-dca308ad216b","resolution":{"observed_at":"2026-08-04T18:49:23.710023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:23.826123Z","title":"The Mixtral-8x7B Large Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:23.826123Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:8e4fb14966a55fb6e450fccf205cb7e38440f0b66e5799ae4f5590a10fb78630","observation_id":"9ef64e5d-7e77-42b0-8889-997a0ab070de","resolution":{"observed_at":"2026-08-04T18:49:23.826123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:23.994646Z","title":"NVIDIA NVML API,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:23.994646Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:e8c04280ef5104a4f18f219e7be9abf65848c62c0e2d2bf4637f38d8af5851ff","observation_id":"7a549a92-6e5b-4dda-bd38-c611ca53b34b","resolution":{"observed_at":"2026-08-04T18:49:23.994646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:24.167873Z","title":"TensorRT-LLM,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:24.167873Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:55f27c079df5732ed2c00f23eb14359efd2cb6231ca7535b44054e09b1f10485","observation_id":"d43d3f0f-5404-4a5d-a9a7-df170b12c193","resolution":{"observed_at":"2026-08-04T18:49:24.167873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:24.333635Z","title":"Chatgpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:24.333635Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:333e13202244016750266fc41003c53ad692f501706c171e8bde4fb65115ebe9","observation_id":"b59d7b1f-d478-4908-a202-92558e179c5f","resolution":{"observed_at":"2026-08-04T18:49:24.333635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-10T21:29:53.476151Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-04T18:49:24.556527Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:24.556527Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:05b0a0b283752b347ec1cd6c4dc77944340512a0335062dafd8ae0de6e9b375d","observation_id":"58744b07-d77d-4831-a327-7c569edba536","resolution":{"observed_at":"2026-08-04T18:49:24.556527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:24.764905Z","title":"Characterizing power management opportunities for llms in the cloud,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:24.764905Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:d4d38bc901b2f4c9e6fbbf4d5bba761b134018ab4d9044e227f1b16c093676b4","observation_id":"5ab4d207-f061-4a53-b638-09625136db28","resolution":{"observed_at":"2026-08-04T18:49:24.764905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:24.900705Z","title":"Scikit-learn: Machine learning in Python,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:24.900705Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:3c6996dff8cad9ff7123b485cfd900749e0795a564daf70a4cdf701de02852a8","observation_id":"54002eba-c663-49c7-bb85-6036f9d4ec6c","resolution":{"observed_at":"2026-08-04T18:49:24.900705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:24.994295Z","title":"A study of generative large language model for medical research and healthcare,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:24.994295Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:962f5e6b3ab3ed40746d496c7212231dccc2ab56814b8fa3ee07d99d4eeb2beb","observation_id":"47f16d29-84ed-4854-a1d6-e6d4afe4c52b","resolution":{"observed_at":"2026-08-04T18:49:24.994295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:25.240563Z","title":"Mooncake: A kvcache-centric disaggregated architecture for llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:25.240563Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:da8b40202120a5faec5ca4cd7dbd0f40b4df815d592a84477b7664777c11b19d","observation_id":"5ab04deb-8913-4d50-9b27-0d582d93e81b","resolution":{"observed_at":"2026-08-04T18:49:25.240563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:25.412580Z","title":"Accelerating retrieval-augmented generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:25.412580Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:8962532cd355cb4cc7acf8d8cbaca65d0b02c4ea01ac8a6802f5f8de9f0160ed","observation_id":"e9ebd65c-c8b8-42f3-8606-daea37da5e80","resolution":{"observed_at":"2026-08-04T18:49:25.412580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:25.582523Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:25.582523Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:d9aace3db1a76d029341c371e26dbcb03c150e05f56bbb7a5132d392556a0867","observation_id":"3cded0ae-83a2-4c83-b703-5000c6474660","resolution":{"observed_at":"2026-08-04T18:49:25.582523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20306","last_updated":"2024-03-29T17:22:48Z","snapshot_observed_at":"2026-08-10T13:32:41.965262Z","submitted_at":"2024-03-29T17:22:48Z","title":"Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20306","snapshot_observed_at":"2026-08-04T18:49:25.678359Z","title":"Towards greener llms: Bringing energy-efficiency to the forefront of llm infer- ence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:25.678359Z"},"links":{"cited_paper":"/paper/2403.20306","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:4619bf3fecf9cca73a94943f399eb6ee6dd94a93b3440622e50a1d32a3d7c821","observation_id":"7c39d644-88c3-475f-8410-d9ef367d75cc","resolution":{"observed_at":"2026-08-04T18:49:25.678359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:25.845086Z","title":"Dy- namollm: Designing llm inference clusters for performance and energy efficiency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:25.845086Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:e592c124f327db55e2e6ee906e3c82d121b74a0f63fc8b14666aac9348960a2c","observation_id":"9d2e6577-78f2-483f-8cd8-6c321991c303","resolution":{"observed_at":"2026-08-04T18:49:25.845086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T18:49:26.105281Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:26.105281Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:c6794ff310726655b106806f40b6ee2055999be36fb377bbec0a31a3c86c4f78","observation_id":"84f707d1-3c7e-4b6c-9620-10046c86d5c1","resolution":{"observed_at":"2026-08-04T18:49:26.105281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:26.278741Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:26.278741Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:c61ae3fa8c3a838c29170df425f3b0cde578ad99691414e14a625a7b897b978c","observation_id":"e741e68c-649e-4678-8028-0a09900ed3ec","resolution":{"observed_at":"2026-08-04T18:49:26.278741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-09T14:08:47.340904Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-04T18:49:26.444410Z","title":"Fast distributed inference serving for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:26.444410Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:64e9b44c5c3c2dc37a17e602bf5e4ea9d397fc1962ad45aadfc9a4c0fe15217a","observation_id":"32477326-cf53-49a0-bba3-40945c07fecc","resolution":{"observed_at":"2026-08-04T18:49:26.444410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:26.618236Z","title":"xdeepserve: Model-as-a-service on huawei cloudmatrix384,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:26.618236Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:cbccffbce6ce4290581fc05eaff75374379cae59cf867ca4945c91a9b77134dd","observation_id":"68d6a954-3afd-4f8a-9844-63303edc836d","resolution":{"observed_at":"2026-08-04T18:49:26.618236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:26.807560Z","title":"Orca: A distributed serving system for{Transformer-Based}generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:26.807560Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:17326c0068b6f5e52408d1aed5595962200f6377e67f17f35c0fc10ab7f42387","observation_id":"4cb5a811-269a-4111-b665-e4ca18f0ba36","resolution":{"observed_at":"2026-08-04T18:49:26.807560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:26.972179Z","title":"Flashattention-4: Algorithm and kernel pipelining co-design for asym- metric hardware scaling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:26.972179Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:d44438a6948431dc397ba43fe191db936ff15b7d639965b7d63997e4d72c6712","observation_id":"613bd53a-614b-4575-9df9-2b3852c3a5e1","resolution":{"observed_at":"2026-08-04T18:49:26.972179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:27.145577Z","title":"ZeroMQ API,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:27.145577Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:5bf3f2dc3fb3059458df7e753091592d952df208b8aedb36d0caa8fd7a1183fa","observation_id":"130dfaaf-46ba-4f50-abe4-03c045b3c6c3","resolution":{"observed_at":"2026-08-04T18:49:27.145577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-04T18:49:27.314415Z","title":"Efficiently programming large language models using sglang,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:27.314415Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:41d574bd6f2aa3af14fd87c3beff8dc54f9448ae014b83aeda1e9358b02e4f47","observation_id":"54ee6a5e-891b-4c64-bad8-269bd69d9b41","resolution":{"observed_at":"2026-08-04T18:49:27.314415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:27.475602Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:27.475602Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:ae7861198d1ebf32a7fed9e0c91e9080e72dda561f22a53630e8a08d6bc5a4b0","observation_id":"3c37b2b4-f27d-4ada-8ab9-0926f0f264ab","resolution":{"observed_at":"2026-08-04T18:49:27.475602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:49:27.634595Z","title":"Megascale-infer: Efficient mixture- of-experts model serving with disaggregated expert parallelism,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:27.634595Z"},"links":{"citing_paper":"/paper/2608.01891"},"observation_digest":"sha256:1833bba0514d1fd674be03a9931f35651520c1acff073156edb09ce372a98613","observation_id":"ab2e0bd0-1e48-40aa-af6f-10cf8bedd45b","resolution":{"observed_at":"2026-08-04T18:49:27.634595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01891","last_updated":"2026-08-03T08:32:50Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T23:33:24.457506Z","submitted_at":"2026-08-03T08:32:50Z","title":"Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.01891."}