{"as_of":"2026-08-18T15:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f188e03ddd73fda244768ed83770bd6272e9448ee682ecb35c12ae13e516decc","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T22:53:58.352008Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.17787/citation-record","integrity":"/paper/2606.17787/integrity","json":"/paper/2606.17787/citation-record.json","paper":"/paper/2606.17787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"https:// docs.vllm.ai/en/stable/deployment/k8s/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:78f9bb2ac5e5ff8625e1916c6dade7a866bc8ac3606ca1a981d3ed7764e9ef21","observation_id":"a50ef0c8-068d-4fa3-9305-9fbaff6a797e","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"https: //github.com/flashinfer-ai/flashinfer, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:5ff2de15611e6058a7c3219ea3c58118f04ebfd893742e10ffa2be6e1f8d9e23","observation_id":"df5d1cf0-a1c7-4c6d-b9b1-43563d9ff6c8","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:7eb17003856318706da015df1b56ca1d0808b695f94f938b61b0ac0af766e45f","observation_id":"3eec8535-1c49-4233-8c49-e7445cde2f5c","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"https: //huggingface.co/docs/text-generation- inference, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:43a440e6b7f6be4878138a7352ca1d750a27976b3a20d06fbba9ca2b8c31c180","observation_id":"acf3725c-eac4-47f5-94b1-c5d9e7be79c4","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"https://github.com/kserve/kserve, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:f86469b1a1418b330f42e9db41d405a6d42d7445c1a67a216f245fdacc92df58","observation_id":"701ca8b4-f9b7-4b55-8585-2de165840038","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"https: //github.com/triton-inference-server/server, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:0e4c0b2b6c428d846f4ec5a715f6853f75936eb5b00927e7fa0016cacf691abd","observation_id":"23f45e03-73f7-413e-a239-e7085c7510c8","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"https://pytorch.org, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:6963f5b33ae76e68500fb0025a0479b128887887e529dab677aba749ec67015c","observation_id":"c4695858-47cc-434c-a8e0-c99a4a748883","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"https://zeromq.org, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:bc41d343593f0a85a3c599ed4a28e5e58194dd0a1c9336e8ddcb87927a56f127","observation_id":"afd8ff5c-6475-49f8-9b2f-9e36f1cd873e","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Vidur: A large-scale simulation framework for LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:76064082a0e53e0ae1d53eb99becf66f8a65163f3dcaa6fef2723cc8c2402df3","observation_id":"b713c946-798f-4d39-aad2-cdf79a4cd3a1","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Taming throughput- latency tradeoff in LLM inference with Sarathi-Serve","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:4fd536e4a52c2373e0942baaa182ad3412848a6bc8ead76c9ae452b275da8f89","observation_id":"cf4fbf55-0dfd-4729-8e6a-f573a0dda2e6","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:21138c0a2c5f9afa428451caec3ce786b30a91a0df3b161983c9f62a74a60179","observation_id":"31f6ed29-fa9a-4e33-98c0-5ede73efd04a","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":"2302.01318","doi":"10.48550/arxiv.2302.01318","metadata_source":"pith","pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","venue":"cs.CL","work_id":"b53b11e5-8613-439d-9d9d-0e2a9090d79f","year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:7596445ec62cea78d56f32b9a2fb3964e427f50193cd393ef101a423b310a21a","observation_id":"98d1a7b1-350b-44ed-9c07-be3785c4ef8b","resolution":{"observed_at":"2026-07-03T23:09:01.189168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Recycle: Resilient training of large DNNs using pipeline adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:a04f9ecde04232c660f9e9459139669e228855760a7a911df1a5215c4c324287","observation_id":"8d98aca0-3450-4bb5-8e64-ca52f26e3ecd","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Cost-efficient large language model serving for multi-turn conversations with CachedAtten- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:701dc57c807f2edd3e9a46c8610bd7aa20fe46c65cf2fe57282988e4ee23c71d","observation_id":"94ea7503-a455-4be8-9f72-d01228cb1099","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Characterization of large language model devel- opment in the datacenter","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:abc285b3566ee43e629159fb7c12f0024e7e3af322b3d0ad7482bc55b034b515","observation_id":"a747b482-a093-44e9-b235-fc9c34e81dfb","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Oobleck: Resilient distributed training of large models using pipeline templates","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:4ea1c0277d35b0232ef64eeffeefdb5a16367e58b0424ca8a7afa9e22d98ef76","observation_id":"56d1b946-fa90-4ad8-ad8f-bfb6e3f6d005","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"GhostServe: A lightweight checkpointing system in the shadow for fault-tolerant LLM serving","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:ed2d235728c2ad00c59fdaccd005323ada63b5107db238acd8c06032e4501d34","observation_id":"515ecadb-84bc-437c-8c44-7a9e3072bdeb","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"MegaScale: Scaling large language model training to more than 10,000 GPUs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:e9ada7206c54561b767199c3cd024cc477cb56515c4b08aef979fc76059ed008","observation_id":"95689ca0-8f85-440a-8936-2ef05fadd90c","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Revisiting reliability in large-scale machine learning research clusters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:2dee7b63ec978f89fae6914cc394b71ba897667ab4fb54cb7f1a91e87008fd46","observation_id":"ed395e94-2832-470a-ad0d-f0f5027ebac4","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Efficient memory man- agement for large language model serving with Page- dAttention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:d2fa2dd3bfca21a9d1dc95c443621f2f94700860b9cdc459344a385cec0cbdfa","observation_id":"8bc8901c-819e-41fb-ba2a-8d082e8e96a7","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:1d10361ee0753c35d89317eebf0cfe56502cc2f06c1a5b399297f14c02d17630","observation_id":"5175a2b5-3a68-4f8b-8a1d-cfa9fdadb63e","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"PEARL: Parallel speculative decoding with adaptive draft length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:a43b0d8433065e25bbad18035a2262008507f8d9137837e30ab4825f66abb0f1","observation_id":"added2ae-d8c7-463b-9ed1-25ef75b9edc5","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"CacheGen: KV cache compression and streaming for fast large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:0ee608a004022f0ac40e414c1a7d3e0c2063b2205c1712b75b61167603bfecce","observation_id":"eb39cfe3-cd5f-4adb-87eb-ef22e76cc1ee","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:3dde1df7c3401c5c7c38b3111ece751b2a2952bb6baa2a33ea3ee5a06101cedb","observation_id":"5bac4c3d-c534-47ac-855a-ef8d24467246","resolution":{"observed_at":"2026-07-03T23:09:01.186199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"AMUSD: Asynchronous multi- device speculative decoding for LLM acceleration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:ced2e10425939f36f57ef26178c7aabe3c38230bd433201d70224d570ad85ae5","observation_id":"dba359e2-87a3-45fd-a6a3-4205127ea8ab","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:f31baf922e617657076727cb560c93d997228e636692f8e0c1816feb3acfce65","observation_id":"f31f6144-a051-47f3-a1be-f18954711ad6","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"ECCheck: Enhancing in-memory check- point with erasure coding in distributed DNN training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:78c45adf067f47f0f0eec8bf31b2ce824e060aebafa05cddf191580b8e95d100","observation_id":"19009165-96f7-46d6-9df1-04dc08ef38c7","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:09:01.191887Z","title":"Towards resiliency in large language model serving with KevlarFlow","venue":null,"work_id":"e44ed12b-69d2-439e-9cd5-83cbd7f5654c","year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:1ca3083932789f1ef218faf6f75810d2ce0413a9acc6ef95a055b45c4d467240","observation_id":"4ad37d1b-49c6-43b4-a423-a497bfc98a1b","resolution":{"observed_at":"2026-07-03T23:09:01.193291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Mooncake: Trading more storage for less computation – a KVCache-centric architecture for serving LLM chat- bot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:4bacefd045733f7b3d2c7942b6c262cb79e813962639f77825df7a9e3688f06b","observation_id":"153437a6-363a-4fe3-88a0-09f5421cd3e1","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"ShareGPT conversation dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:e0884c154d3a288a74a9b652a7313a26944560c751604d8765ad75ac94cfbd71","observation_id":"360ecb2f-7a53-46a8-aebe-021cd4b73805","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"FlexGen: High- throughput generative inference of large language mod- els with a single GPU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:bb72516ed2db38319104400d831f2ac7c4a4d8497f20e704fb0477b3f84396a5","observation_id":"5fc473c8-2533-4ddb-9c19-f87ba7c755f4","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"DéjàVu: KV-cache streaming for fast, fault-tolerant generative LLM serv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:7253bfef05762464fdc7a1b890692bb7cd94726d45c966b5c2b8473b628a731a","observation_id":"0befe7a2-ac5b-4a55-a9cc-07357fb3f436","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Llumnix: Dy- namic scheduling for large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:8fd1a1d068950b3d84780f74be32d2353515e682d99abba8f729db1ac5884f36","observation_id":"94d765e1-aebf-4d92-b496-5c9e849f8c99","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Bamboo: Making preemptible in- stances resilient for affordable training of large DNNs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:2ec4caab75c529de432f557bb79a6b5dd6b8cd4a3eb56fad6d59bb86b16a7c50","observation_id":"fb7d7f18-bf5b-48ad-b556-301b453006ff","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:b515b0633a47b15700d85adbdd2d8d138f9b6528e53a57a21a03a229dd43477d","observation_id":"e352b913-5f7a-4493-8a1f-644d3e34d3d3","resolution":{"observed_at":"2026-07-03T23:09:01.195699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:23b25cfed3a754ed6b7836aa84d967b057a77fd1bb117d1d4e04d24385c822fa","observation_id":"60346195-0523-4335-bf39-8b4459dc9add","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"ByteCheckpoint: A unified checkpointing system for large foundation model development","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:07edf16210267ddf882dddedaef3729b8853a245ee8b086cf9d5ab077b100a4c","observation_id":"3b86e601-9fd8-484d-879f-9d759b9a2487","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:5d49886f11eace5e15bcac5a3ffc8eae34a69eeac3a06629564e39e98392f748","observation_id":"767c681d-bcb1-4ac1-aa04-ad2c3c248818","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Fast distributed inference serving for large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:96daadc55d85eac269a6a1aea01059560b81c9ac01ffd9706e19f0c0d2f15e86","observation_id":"d92a333d-db58-44b8-a9e6-6bed58a0a42a","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"FailSafe: High-performance resilient serv- ing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:e48881aa4197a6224b61942b5bfb6ffdee8dd7ae1356e79e999fc8789117a36d","observation_id":"6d92c734-89a3-4b37-8d4f-b355a1466328","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:40a03c21a841a4f875e7c79351f48c257af8cb45f1e898db3bd59664b0fa2ae1","observation_id":"132556ef-0f08-4109-b294-bf595c950621","resolution":{"observed_at":"2026-07-03T23:09:01.191928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Orca: A distributed serving system for transformer-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:fb2dc858ccd09714d0de3d9d095d656dbd9295b4cb373325f66b327285172676","observation_id":"147a22fe-75dd-4747-8ed3-2c5113223e8e","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Gonzalez, Clark Bar- rett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:2c66b136878a95570e1712d0ce6e5acaa56306e6b6f9536ac0b956e438f42bdf","observation_id":"7c57243e-6044-475c-a09e-84826308776b","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Dist- Serve: Disaggregating prefill and decoding for goodput- optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:12d2b309371f6e01ffc54c51720a2250a27a629c642804d35dfdfa70fef56cb9","observation_id":"a2349f40-b36b-4963-bab5-575d3f837a11","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T22:53:58.352008Z","title":"Resiliency at scale: Managing Google’s TPUv4 machine learning supercomputer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T22:53:58.352008Z"},"links":{"citing_paper":"/paper/2606.17787"},"observation_digest":"sha256:382fab2cf65772b12f37376ea8a2811c0e40e8c4f34628d4a352c0c022553299","observation_id":"650d2676-44dd-4bc8-8308-af8833cd27e8","resolution":{"observed_at":"2026-06-26T22:53:58.352008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.17787","last_updated":"2026-06-16T11:02:20Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:02:20Z","title":"LUMEN: Coordinated Failure Recovery for Distributed LLM Serving"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2606.17787."}