{"as_of":"2026-08-09T14:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7559debe73d3c9790f9c5c8b556bcac79fe36a16c34fc6ebe3ac2de8f8ef4954","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:48:37.632916Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03741/citation-record","integrity":"/paper/2608.03741/integrity","json":"/paper/2608.03741/citation-record.json","paper":"/paper/2608.03741"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.935853Z","title":"Inside NVIDIA Groq 3 LPX: The Low- Latency Inference Accelerator for the NVIDIA Vera Rubin Platform,","venue":null,"work_id":"5eac6e51-d0be-49b5-8fda-360e10568a36","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.637417Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:bcd6e90fbabdb3659391d661b1acfba5e9c94b58a800d9191e1b66aaaeced54d","observation_id":"5b1323bf-6dc8-4b82-8327-b798dc56b6a0","resolution":{"observed_at":"2026-08-05T13:48:42.015889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.774095Z","title":"Web agents with world models: Learning and leveraging environment dynamics in web navigation,","venue":null,"work_id":"54b0db77-36a2-4dfa-a869-1c8589b3246e","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.696373Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:359aeea637834be5a460852044d622367443941142e8e10d9b294cc8fd6adcfd","observation_id":"4917b56c-8c02-4fbf-aceb-270e8b77fd89","resolution":{"observed_at":"2026-08-05T13:48:41.841775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.655384Z","title":"Llmservingsim 2.0: A unified simulator for heterogeneous and disaggregated llm serving infrastructure,","venue":null,"work_id":"bbec2567-c585-4deb-a1c6-004a3135df88","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.768955Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:bdd7db5ed0c464b712d8382db102308313ddb79aa72fa67ef9bd8bd88ca57b51","observation_id":"4bc64967-f6e2-4e7b-9463-98dfd1d95a08","resolution":{"observed_at":"2026-08-05T13:48:41.709830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T13:48:34.861373Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.861373Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:3b58d5983a414675f30cc0e8d3d5a8a3f6c2cf4b413c7c21445c5587bf0f1221","observation_id":"e94c5b14-61c8-495c-b5ae-0e421252978b","resolution":{"observed_at":"2026-08-05T13:48:34.861373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.500136Z","title":"Deepseek-v4 technical report,","venue":null,"work_id":"18124a0d-895c-48a3-9eed-e522628de9b3","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.943084Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:26b2e5e86ad3920f56c1a81fcc39c6e0b03eaa1b45b2873d54df3cdf1e162c3c","observation_id":"5e24d336-76dc-4180-af7c-f5f96195ddcb","resolution":{"observed_at":"2026-08-05T13:48:41.594627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.313070Z","title":"Coral npu: A full-stack platform for edge ai,","venue":null,"work_id":"ee9a0cf2-a5bb-4432-ae77-634ce6bb7605","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.017260Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:ab02378674d0990f4472e9e837c4f757b3ec0ba6fed6a945cd3d30933743b547","observation_id":"4a8b2a17-e09e-4ba0-935c-11cbfd20c0b9","resolution":{"observed_at":"2026-08-05T13:48:41.414349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.134446Z","title":"The llama 3 herd of models,","venue":null,"work_id":"35461275-1876-47b2-a366-d873d5504ed4","year":null},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.075757Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:f36ce834dadc042c77017fdef0c632afae330c2ccb9e5b28bb5fa8861130c952","observation_id":"8e296dde-dde5-46b4-948d-f2c40e5f3a5f","resolution":{"observed_at":"2026-08-05T13:48:41.208892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.982023Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models,","venue":null,"work_id":"be55c529-d8e9-443c-bec6-3331885b84b2","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.263768Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:b2babfa8807319c408a5bdeadf3cd419a09cfca11ba497127a486acab6c692e4","observation_id":"039c93ab-396d-410f-9505-dad9ac140e02","resolution":{"observed_at":"2026-08-05T13:48:41.052218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13358","last_updated":"2026-05-05T10:21:59Z","snapshot_observed_at":"2026-08-02T12:32:31.923333Z","submitted_at":"2026-03-09T06:11:23Z","title":"Not All Prefills Are Equal: PPD Disaggregation for Multi-turn LLM Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.13358","snapshot_observed_at":"2026-08-05T13:48:35.375376Z","title":"Not all prefills are equal: Ppd disaggregation for multi-turn llm serving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.375376Z"},"links":{"cited_paper":"/paper/2603.13358","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:ea50a98c826ae2c84b861e5136906a7c6f4e2323115382bd6f68a7710fda2b99","observation_id":"72d5d76a-1401-4d01-b148-785036f11671","resolution":{"observed_at":"2026-08-05T13:48:35.375376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.761279Z","title":"The llama 4 herd: The beginning of a new era of natively mul- timodal ai innovation,","venue":null,"work_id":"567eb90b-4a08-47e0-ba4f-92a423edda7e","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.481168Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:544ba87a3a479f9d8ee71fcda5e297dbb4b693690745bb41b380fe0a8020db85","observation_id":"c3ef4ac6-1b75-4ca8-8f78-0a64a8dca847","resolution":{"observed_at":"2026-08-05T13:48:40.843456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.08721","last_updated":"2026-05-29T10:02:49Z","snapshot_observed_at":"2026-08-07T06:51:25.143484Z","submitted_at":"2026-02-10T14:52:02Z","title":"KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.08721","snapshot_observed_at":"2026-08-05T13:48:35.603804Z","title":"Kernelcraft: Benchmarking for agentic close-to-metal kernel generation on emerging hardware,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.603804Z"},"links":{"cited_paper":"/paper/2603.08721","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:d331800095185e0abbeca614040924be0339c432761026be88b70e8f473936f9","observation_id":"45a99a89-d9d7-410d-a84a-0c2143f6064b","resolution":{"observed_at":"2026-08-05T13:48:35.603804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.556944Z","title":"NVLink and NVLink switch,","venue":null,"work_id":"36b84c98-3791-4a89-8dfc-d8446c5d5c45","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.697972Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:7dfa9f93fc32272d25b2658a1169d5dc1b6e304704afa574a9be0e9aefeb6ea3","observation_id":"c4f9b2ba-9676-4e35-8bee-371649d18d97","resolution":{"observed_at":"2026-08-05T13:48:40.625721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T13:48:35.787007Z","title":"gpt-oss-120b & gpt-oss-20b model card,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.787007Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:edfd363e03ef61d92f1eb8f0d8900b298ed426cfec13af806aa9af27bbaec958","observation_id":"cfd5190e-6086-4fda-ac4a-a9ae272a20e7","resolution":{"observed_at":"2026-08-05T13:48:35.787007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-06T12:06:11.068182Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-05T13:48:35.895560Z","title":"Splitwise: Efficient generative LLM inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.895560Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:9651924c6a5cdf70128c32e00de3a8f9c26f0f12ab50c3321a17795f3fd25861","observation_id":"f32fe468-4421-4c07-8a26-922c78e6c6a7","resolution":{"observed_at":"2026-08-05T13:48:35.895560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.360125Z","title":"The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models,","venue":null,"work_id":"5c12d205-db78-4f66-ac8e-ea9c9f0e14af","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.036808Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:6bad849b9960e44b37bdb42e212556b50ecaad4382d950dc77261b1b9db9e45e","observation_id":"7fc07b3d-4afd-49c6-8169-881cabb7c74f","resolution":{"observed_at":"2026-08-05T13:48:40.441203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.059255Z","title":"Mooncake: Trading more storage for less computation — a KVCache-centric architecture for serving LLM chatbot,","venue":null,"work_id":"b2cf789b-e2f2-4847-a8bc-d44d3046b557","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.174144Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:f0e6ee3663aa0d3a6e5ee9f3a2c3a5367551d5821ce203311819b1867cebd01e","observation_id":"a4f6c8e8-3abf-4dce-9528-1ad848211172","resolution":{"observed_at":"2026-08-05T13:48:40.200944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T13:48:36.285131Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.285131Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:3b1f5ee85a20fca9e3449b470fa98c050141c88026793f206f5a3d8030c30321","observation_id":"4a368799-2552-4418-82cb-4f0159ef359d","resolution":{"observed_at":"2026-08-05T13:48:36.285131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.864428Z","title":"Microscopiq: Acceler- ating foundational models through outlier-aware microscaling quantiza- 12 tion,","venue":null,"work_id":"c27c4e24-689f-4b5e-aa32-8cc13f5fa6e5","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.379847Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:f346cf0e59bed294f7bfc7821721e9f208edb168e60ba7ee3cab393be951b53d","observation_id":"8f3e952b-eed5-4671-94d6-7026ca733b78","resolution":{"observed_at":"2026-08-05T13:48:39.974689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.713462Z","title":"Longcodebench: Evaluating coding LLMs at 1m context windows,","venue":null,"work_id":"072d6859-cffa-4ed7-9e5e-f9714eeff884","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.454068Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:cd17f27bdadfbe7094db9c0324ec10b8d6c919159844d4ed2e06f0e6ee0b178b","observation_id":"94a5c529-7c54-4469-ac12-baa9df6dbcda","resolution":{"observed_at":"2026-08-05T13:48:39.785628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-08T01:04:32.134805Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-05T13:48:36.545613Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.545613Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:407f2832eb51532885d0e81f72f75edf5b13bb08a1a391d440effa58f169adae","observation_id":"4833d5a2-b500-44c4-a4c2-19fff570c7ee","resolution":{"observed_at":"2026-08-05T13:48:36.545613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:36.629024Z","title":"Step-3 is large yet affordable: Model-system co-design for cost-effective decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.629024Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:12f4a8e9a0ce138f1a00723c8c666d14c02644c7622fc9b05ba73cee108d05ad","observation_id":"2d7092fc-aef3-42df-b48d-c8be21df4baa","resolution":{"observed_at":"2026-08-05T13:48:36.629024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.528548Z","title":"Attention is all you need,","venue":null,"work_id":"0a938bce-b82b-40e9-a213-425f5567279d","year":2017},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.693499Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:2c8f4d5c76a537a755b492ca1eb320aadcbf490350333d78dad9ac0f09eff1c3","observation_id":"8fdd8148-cabc-4dca-ba8c-bd36b470d259","resolution":{"observed_at":"2026-08-05T13:48:39.608902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16007","last_updated":"2026-04-17T12:29:54Z","snapshot_observed_at":"2026-07-06T23:03:26.308324Z","submitted_at":"2026-04-17T12:29:54Z","title":"MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs","version":1},"cited_work":{"arxiv_id":"2604.16007","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16007","snapshot_observed_at":"2026-08-05T13:48:37.920686Z","title":"MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs","venue":"cs.AR","work_id":"2cafb8bd-8fbc-43a4-840a-5661c4f57fad","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.799912Z"},"links":{"cited_paper":"/paper/2604.16007","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:9e6be798b30c76f2e5a324f546fdc0a48164ec0cc1addb3c09d0cc4754d70f17","observation_id":"825ce3a6-33d0-4c3d-abf2-746d907971ec","resolution":{"observed_at":"2026-08-05T13:48:38.002161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09505","last_updated":"2026-04-12T10:29:26Z","snapshot_observed_at":"2026-07-06T22:28:48.082201Z","submitted_at":"2025-09-11T14:49:50Z","title":"Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09505","snapshot_observed_at":"2026-08-05T13:48:36.864717Z","title":"Combating the memory walls: Optimization pathways for long-context agentic llm inference,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.864717Z"},"links":{"cited_paper":"/paper/2509.09505","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:0002e57bdfd39148b7ee0bb0da408dcc7559ac75747c38c4b538ebb313cdbadb","observation_id":"35cc6f7d-513c-4d5d-af3b-4658d545bf61","resolution":{"observed_at":"2026-08-05T13:48:36.864717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.311292Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments,","venue":null,"work_id":"72720d81-a619-4978-a033-48d84b67c122","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.964339Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:84b981fe2f87c440f58f731af7b205ec1d4b13c5c2c84b09724c7fb200e95f4e","observation_id":"470641ae-f7fd-491a-a5df-906aa9c61427","resolution":{"observed_at":"2026-08-05T13:48:39.434810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03868","last_updated":"2024-01-09T06:47:46Z","snapshot_observed_at":"2026-07-06T17:12:47.723473Z","submitted_at":"2024-01-08T13:00:53Z","title":"FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03868","snapshot_observed_at":"2026-08-05T13:48:37.037252Z","title":"Flightllm: Efficient large language model inference with a complete mapping flow on fpgas,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.037252Z"},"links":{"cited_paper":"/paper/2401.03868","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:64f4ccba3c58d1816cc26fffe73bf68526f9b6794e131f051f8ded0d312e8749","observation_id":"42076615-39d6-4aac-b043-0079714b0cd1","resolution":{"observed_at":"2026-08-05T13:48:37.037252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.197279Z","title":"MR-GSM8K: A meta- reasoning benchmark for large language model evaluation,","venue":null,"work_id":"93d6c28c-8fdb-4568-bade-cd63f1d95317","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.140810Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:96c0aadd5a5d1c7d71ceffc7b6a23b7cb7639462598999c662d1b80546e3988f","observation_id":"c2eee7e2-fdca-4fa4-97a4-7e46e8059e95","resolution":{"observed_at":"2026-08-05T13:48:39.257272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.012593Z","title":"Mase: An efficient represen- tation for software-defined ml hardware system exploration","venue":null,"work_id":"83791bb2-05c7-4507-99bd-81fbd9a4dcbf","year":null},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.250129Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:b3115d772ba67c3cd11654d32cc65fa7bc49c6736c79d2229a68665da46b8198","observation_id":"0bdc0f63-0938-462b-b470-c30d5c262fbf","resolution":{"observed_at":"2026-08-05T13:48:39.102770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:37.345909Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.345909Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:52bdb88a51b80b97c69bf09737108f2067724eec41f74a1369928c06d2a87476","observation_id":"7cb9be3a-f18e-4d21-9ba3-f2f09ae1db76","resolution":{"observed_at":"2026-08-05T13:48:37.345909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:38.736649Z","title":"Glm-4.6,","venue":null,"work_id":"5dc96a5f-295a-48b4-87e9-6545ae3590eb","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.397127Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:57fdab6c37057fbbb49a97e3fc77a61f65b23703fd5a3e39ee6eea0f35877ca1","observation_id":"25e468c8-ab4a-4e0c-8ff8-116626317461","resolution":{"observed_at":"2026-08-05T13:48:38.921208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:38.549422Z","title":"Distserve: disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"18d27154-9990-45e3-9fca-7564c4f41938","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.535768Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:f8d5c2d04154b2afe8bf79fd3e1eaa9ded3b4a133eedb2eb9c7c211b9afa5d69","observation_id":"0024333a-9f93-4412-914d-fe1da8eb7ba8","resolution":{"observed_at":"2026-08-05T13:48:38.671433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:38.298744Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"f7219329-d43b-4654-8f62-e839eea81ce8","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.632916Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:9283967f2d50667ec6b9bd12658b46de51563b2d70993753662b643389be8b7e","observation_id":"008bf376-6b11-4ac8-af99-73d24bd3d643","resolution":{"observed_at":"2026-08-05T13:48:38.421954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T13:48:35.172321Z","title":"Available: https://arxiv.org/abs/2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.172321Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:8a101c91f5e39d8e1d499ab63dd82495ed39a11cae83fdc98740d2ff5b0cb7ba","observation_id":"1bec9d0f-f8b6-4ec7-8115-65790dc4223e","resolution":{"observed_at":"2026-08-05T13:48:35.172321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-07T23:12:22.736778Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2608.03741."}