{"as_of":"2026-08-08T01:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a17abfc778994fbc0067aa3eb8d8d6f262fdd8838afe548fa64bd02982da6b2e","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:21:08.635007Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22033/citation-record","integrity":"/paper/2506.22033/integrity","json":"/paper/2506.22033/citation-record.json","paper":"/paper/2506.22033"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.810543Z","title":null,"venue":null,"work_id":"1b2d715b-f6d8-49b7-b2cb-15fcabcc7355","year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.448663Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:af7aa9b9688f72fcb1261ada1dd0fb6b882339ad70977d41edcb76406759168a","observation_id":"eda8f667-6c97-40e1-8709-c7640524db87","resolution":{"observed_at":"2026-08-06T22:21:12.863562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.647560Z","title":"Llama 2 follow-up: too much RLHF, GPU sizing, technical details","venue":null,"work_id":"843fc084-c8d7-4058-b971-3bd80ca72b85","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.523091Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:863c30338ebffa955b02086a1fbb8a2bce5bffd11bbb9bd9b046b53b279ed869","observation_id":"a7e2ca0d-ed95-45fc-abf6-f24ce6039877","resolution":{"observed_at":"2026-08-06T22:21:12.743116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.440459Z","title":"AI Inference Market Size, Share and Trends Report","venue":null,"work_id":"b0d59853-cf07-4134-a47c-140fe4958dca","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.589199Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:97a233b800ed6bb011527fc058727dc4a4c3757050b65c1763337c53b2f921da","observation_id":"27287006-71ea-4b4f-aee3-782b6863c827","resolution":{"observed_at":"2026-08-06T22:21:12.550883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.204872Z","title":"OpenAI API Documentation","venue":null,"work_id":"faaecf9a-55d8-4fbd-991f-4ab14a7b8713","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.662099Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:599a506cf2e4b341f71506ec0efc7ddaac0f015379cf8219eb04e5658f28e857","observation_id":"68c9c1f6-c288-418c-85e0-dbd25802cb0b","resolution":{"observed_at":"2026-08-06T22:21:12.301445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:12.007352Z","title":"ShareGPT Datasets","venue":null,"work_id":"f01b33d5-321c-4be4-8116-8a4896f5e598","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.755064Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:2339294bfbdd3b899f07e745e259b99ff4b069a6f7c17e2b95d80a4757ae9aa5","observation_id":"668572f2-9761-4394-81f0-0ed57fa41f2e","resolution":{"observed_at":"2026-08-06T22:21:12.099360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.753949Z","title":"vLLM–Optimization and Tuning","venue":null,"work_id":"0232e3e7-5b17-4766-9f7c-5d8e73826a3a","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.834539Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:aef7072adf235b69af386ffe6c44bde9b24cbf8ae559f55eae8e817b6ec82d81","observation_id":"8fe31ad3-be65-41c5-9159-e878d7be02f9","resolution":{"observed_at":"2026-08-06T22:21:11.863187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.655507Z","title":null,"venue":null,"work_id":"88566e21-0ca6-45eb-81cf-873e224737ec","year":1985},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:14.945681Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:bbbf4b7105d195b9fe6a4552dddcf25bd19637629fbc3be595ff09ed5983f040","observation_id":"4deeb3c9-ff8b-430a-8f4c-eb8486bcac22","resolution":{"observed_at":"2026-08-06T22:21:11.726600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.522814Z","title":null,"venue":null,"work_id":"7105b1e8-34b9-4378-8c41-27fa9b1b523d","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.016310Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:b6d7bc814ee96f3ce4c50f1837c40d62e4cd06a7ecc66dbd9532e000feeb2a47","observation_id":"483eb470-30d0-4c87-96da-62ab4b519120","resolution":{"observed_at":"2026-08-06T22:21:11.584750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.390743Z","title":null,"venue":null,"work_id":"5cc18738-e3eb-480a-bc57-d66b85f98cce","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.106452Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:b9bb10efd22e774e50a01f72c6f08c714ce53be534bc2e2258b9d341c271d510","observation_id":"e3094ddb-046f-4c7f-ad34-77e5c2a2f2e9","resolution":{"observed_at":"2026-08-06T22:21:11.432438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-07T11:38:07.397956Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-06T22:20:15.212688Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.212688Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:64a34f56d4860f7cee181cfb95e9c7afca88969359050355da7339d1c9f932a7","observation_id":"8640ffa2-d7a3-4b79-abce-c8e5e86284ec","resolution":{"observed_at":"2026-08-06T22:20:15.212688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.294276Z","title":null,"venue":null,"work_id":"7b285db4-85b8-4c93-9d8e-e5f8db02e4a9","year":2020},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.362759Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:4852a6063daf29a9f99c201e86b994894a3f29610846b99f89ca389a460e2d5f","observation_id":"28b0a20a-608e-4a84-b9cd-64802d1e956d","resolution":{"observed_at":"2026-08-06T22:21:11.349478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2024","last_updated":"2014-06-08T20:52:15Z","snapshot_observed_at":"2026-07-06T03:45:47.981395Z","submitted_at":"2014-06-08T20:52:15Z","title":"Hilfer fractional advection-diffusion equations with power-law initial condition; a Numerical study using variational iteration method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2024","snapshot_observed_at":"2026-08-06T22:20:15.500147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.500147Z"},"links":{"cited_paper":"/paper/1406.2024","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:ed667f2d30444c56d57839caa6f14dd209234143d29b112f98623f6131d8cecd","observation_id":"4c9d6a34-cb93-46be-b390-3dbaeabb0195","resolution":{"observed_at":"2026-08-06T22:20:15.500147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11414","last_updated":"2023-04-22T14:09:14Z","snapshot_observed_at":"2026-07-06T15:18:45.940190Z","submitted_at":"2023-04-22T14:09:14Z","title":"Pipeline MoE: A Flexible MoE Implementation with Pipeline Parallelism","version":1},"cited_work":{"arxiv_id":"2304.11414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11414","snapshot_observed_at":"2026-08-06T22:21:09.413492Z","title":"Pipeline MoE: A Flexible MoE Implementation with Pipeline Parallelism","venue":"cs.DC","work_id":"25815a7f-34a3-4bca-bbce-e0e83a5de293","year":2023},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.603651Z"},"links":{"cited_paper":"/paper/2304.11414","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:15e21a7e89092bf028ee53d1e7be6346b388cf4d7ef66ef826b0fe67c6e4bdff","observation_id":"350d479b-3d67-42c8-930c-01e10176205f","resolution":{"observed_at":"2026-08-06T22:21:09.451557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:20:15.704474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.704474Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:6b61a546ed76c1ecf6ebe0015b5e1b5bb6c7cde373a891f9f56ac3594da210e6","observation_id":"cf1e1b8c-182c-4363-b042-b7af0fc35e48","resolution":{"observed_at":"2026-08-06T22:20:15.704474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04833","last_updated":"2018-05-13T07:07:08Z","snapshot_observed_at":"2026-07-06T06:38:48.758485Z","submitted_at":"2018-05-13T07:07:08Z","title":"Hierarchical Neural Story Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04833","snapshot_observed_at":"2026-08-06T22:20:15.795643Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.795643Z"},"links":{"cited_paper":"/paper/1805.04833","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:08328458e9cdd91ed31016ed695f5f719c1d2b1583a1069d87b3289ca1e957c5","observation_id":"69d42e74-a598-4bce-8b85-3f8147ce0421","resolution":{"observed_at":"2026-08-06T22:20:15.795643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.213175Z","title":null,"venue":null,"work_id":"194491ed-78ab-470c-a848-8805d11ef3e2","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.876134Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:255e61eeae906cef68484daec5cb97bb12d8840db97dfb578209bf24059e1f23","observation_id":"d82b7fb0-3dec-4317-b55d-62d7d524cea7","resolution":{"observed_at":"2026-08-06T22:21:11.240085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:15.954063Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.954063Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:089c675bd244d94bf685e87c673f3e3b4977b52cd6ce627c2a1fc2f882acd51e","observation_id":"67316e09-607d-48a7-82e8-eaf985ffa864","resolution":{"observed_at":"2026-08-06T22:20:15.954063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:11.106100Z","title":null,"venue":null,"work_id":"02345678-ca9f-4c76-bf0a-226e265b775e","year":2020},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:15.998595Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:ffdd272c0e31ff23f3d8f60595ba2e1b108ce79e4762003ceef11382f3fee41e","observation_id":"f4f58a12-cd6b-4257-af48-4a0438e3610e","resolution":{"observed_at":"2026-08-06T22:21:11.143841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:20:16.049548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.049548Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:378af45f598b86a80d71753b2d84689fe8f3bcd03b56d10fc495236faad88ebc","observation_id":"afe2f31d-fd0a-4e3f-a1af-958f0bfb29db","resolution":{"observed_at":"2026-08-06T22:20:16.049548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14775","last_updated":"2025-05-28T01:38:07Z","snapshot_observed_at":"2026-08-07T16:00:42.914926Z","submitted_at":"2025-04-21T00:07:49Z","title":"gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling","version":2},"cited_work":{"arxiv_id":"2504.14775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.14775","snapshot_observed_at":"2026-08-06T22:21:09.224994Z","title":"gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling","venue":"cs.DC","work_id":"d963d47e-bfd0-4bc6-8a56-7b8c6c35a9a3","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.114739Z"},"links":{"cited_paper":"/paper/2504.14775","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:60d915e1d26c29b703d9774dcb6f201cd26e1120e2f189b4a98a62290cd600b4","observation_id":"7bbfbc50-d118-4b34-af80-607e28c5d775","resolution":{"observed_at":"2026-08-06T22:21:09.287877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.190154Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.190154Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:929358900f13b0ccf9303bfbe5982278855ae1013c2aa18b45d107a438c8b3e9","observation_id":"89a8467e-b453-40b8-8e93-3be55432743c","resolution":{"observed_at":"2026-08-06T22:20:16.190154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.992828Z","title":null,"venue":null,"work_id":"48b409d1-ea8a-4fc8-9fa5-6ab949dc952c","year":2023},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.258548Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:e73d99db0e4c6a4fbb9b5c18be75c6761c34993c99806404d438cf7fa41c7793","observation_id":"63992c81-8c65-4d35-a313-9d211d0648ff","resolution":{"observed_at":"2026-08-06T22:21:11.024519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.342358Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.342358Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:3474cc1dc07861bfd77cb1abd98810ffd414377a035b4bcc4e94d67aa07de707","observation_id":"629b038b-6b07-410a-a29f-4922ae16be94","resolution":{"observed_at":"2026-08-06T22:20:16.342358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T22:20:16.520554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.520554Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:38b8d5fcee505384fd513a59fe14a497ab5d12d3ce84985200997c70d2b4ccf4","observation_id":"d12dede5-368d-42b3-85a1-9949a2573ab1","resolution":{"observed_at":"2026-08-06T22:20:16.520554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.614495Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.614495Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:056a0ae3118ec885284b9f8e856d5c662e7e536bb5d7444dcfa8796bdb12de71","observation_id":"16e3a6c2-f9b7-4c5e-94b9-2c95b6aa4ea8","resolution":{"observed_at":"2026-08-06T22:20:16.614495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.871757Z","title":null,"venue":null,"work_id":"306df026-0338-422f-9324-d65ab8b2d928","year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.667095Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:a48b325dc0a3e92631412053282eb8c683c71a55a501e672a3dd1c5dca537c59","observation_id":"5d084f37-96ae-4aa0-be5d-434df4b4cf17","resolution":{"observed_at":"2026-08-06T22:21:10.930151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.881512Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.881512Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:3ba2cdee48936b2c554e1d4ef6b6046826b1ca49c0111cde83de5eae07a0b01e","observation_id":"0c7059ae-fd6d-4c0f-b1ea-c9eb65dbaa9b","resolution":{"observed_at":"2026-08-06T22:20:16.881512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.00010","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.050697Z","title":null,"venue":null,"work_id":"6253f443-89cc-4be3-a58b-7baad0a56619","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.644237Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:2c57331b0db73fcc70f7387c1644d2cc711bd0999b6f01d97add0263e374eb3a","observation_id":"b96b25f9-5721-49c1-8109-4d4a7e9ff94a","resolution":{"observed_at":"2026-08-06T22:21:09.118369Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.759368Z","title":null,"venue":null,"work_id":"7ffb1610-7827-4c87-b642-cf99d245506d","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.727480Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:43635aef93c370378d871eb4d9bfd507d6650fa1025f976db007f8d8145428fd","observation_id":"7bc78cbf-e16f-4e8b-af8b-44bacdcbc419","resolution":{"observed_at":"2026-08-06T22:21:10.784355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T22:21:07.812287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.812287Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:49ffdffb2158be758b3893b1de5a6f6446fb3fc376210485def664fd40252852","observation_id":"5508d0a2-44cb-4a0c-8501-fa58a3e1ab7e","resolution":{"observed_at":"2026-08-06T22:21:07.812287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T22:21:07.904773Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.904773Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:a8df37fd7b2db31bc8e02d83e64e035bc84d1f3a5fd2e4d9799c856ea7ca2def","observation_id":"ae5d44d4-a143-4a01-a804-ee47ff718c66","resolution":{"observed_at":"2026-08-06T22:21:07.904773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:07.961712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.961712Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:2b3684a27afdea6e61cf4bb41d5ac421a2e2be4e49eb9e734f0185f6485ed51e","observation_id":"cefce2a6-b69d-41e6-8783-336b31613bd1","resolution":{"observed_at":"2026-08-06T22:21:07.961712Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.637372Z","title":null,"venue":null,"work_id":"3715f0e7-09dc-42a5-a0d2-72e559753830","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:07.985649Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:524ae751796cf0dcf0b046591c0b362e6ba7e39a867ff6e7c36940d375a614bd","observation_id":"4310d535-db69-4f10-a7f5-da9604b867fb","resolution":{"observed_at":"2026-08-06T22:21:10.709481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.542215Z","title":null,"venue":null,"work_id":"9bcfcdba-77ca-4d5b-add0-29420c63a375","year":2023},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.079266Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:41547eaa7614c9297063af97a47836984b887f75098e26a79ca314e6a0bb9713","observation_id":"0950a895-2307-4290-a159-804a45563232","resolution":{"observed_at":"2026-08-06T22:21:10.588607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.398514Z","title":null,"venue":null,"work_id":"07db7992-e2ec-4616-a18b-ed52417a20e4","year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.146466Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:fd925f56df79276bcbc3b7916831c661d27224058b7d64529d9dfc8cf59643a5","observation_id":"098aa4c5-edf9-4cd1-8311-560e59a21832","resolution":{"observed_at":"2026-08-06T22:21:10.481868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.276918Z","title":null,"venue":null,"work_id":"f78e4498-7153-487d-9a05-44c2b8f0b085","year":2009},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.224850Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:f11fdb92814b5dfe7fe9d14b14b756666f2f713594607a0d58bc3e5ccac3b03d","observation_id":"23c3e4f1-55b1-48d2-b753-caa8000d3519","resolution":{"observed_at":"2026-08-06T22:21:10.323146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05149","last_updated":"2022-04-11T14:30:27Z","snapshot_observed_at":"2026-08-05T16:48:50.205106Z","submitted_at":"2022-04-11T14:30:27Z","title":"The Carbon Footprint of Machine Learning Training Will Plateau, Then Shrink","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05149","snapshot_observed_at":"2026-08-06T22:21:08.252474Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.252474Z"},"links":{"cited_paper":"/paper/2204.05149","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:33114c4737a67f918722f1c75bcf4f094ae8c6c88ffbfcdc5a95c96f5828705a","observation_id":"24a13c47-9d69-4473-9ce4-e6d805307483","resolution":{"observed_at":"2026-08-06T22:21:08.252474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.192749Z","title":null,"venue":null,"work_id":"081b7dbc-96d2-4184-9531-f066bb18b162","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.291122Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:b3b8b35b1a1a3d86db0b89e8fee39ca03f4f01e0fef33688a3c0a99961e6e9ea","observation_id":"19a82f40-f7bf-463a-890a-6dfa5ac806b5","resolution":{"observed_at":"2026-08-06T22:21:10.232576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:10.075038Z","title":null,"venue":null,"work_id":"38647eec-4858-4819-92f5-a88f9a1fce8e","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.316471Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:62c4b8f989621dd79ad38c73e4c8bdeae705de5e26ee0576c41ba666b7c9793b","observation_id":"c531d65f-241c-49a2-b291-30be26f522f0","resolution":{"observed_at":"2026-08-06T22:21:10.134845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:08.334204Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.334204Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:2f501128b0215176b07f6638758d11bca414bbd989c59829fc9ae05a2ab72e98","observation_id":"1356f8a4-9c85-464a-9ac5-39522fae388a","resolution":{"observed_at":"2026-08-06T22:21:08.334204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T22:21:08.365349Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.365349Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:c9846284b46a5603b76c9dd2dfed727dd65689517344854140ab34bfcb645653","observation_id":"214c4e61-2956-459c-9afe-5f4bb09df192","resolution":{"observed_at":"2026-08-06T22:21:08.365349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.912462Z","title":null,"venue":null,"work_id":"8e041d54-b844-4817-9e5e-c2f2bc1f5fb3","year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.404913Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:b5db97b55bc8b08700bafd3ebfa5f38101363f48ce6597bdcbc1f09ce887215a","observation_id":"5c9a273f-9b2b-41e0-b87c-de85b7be8551","resolution":{"observed_at":"2026-08-06T22:21:10.025414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.775957Z","title":null,"venue":null,"work_id":"3ca090d2-0894-4f03-9975-d345f2f98d2e","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.433933Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:aa6b27eeca6bc7c574af7261b632a5da93849d266b89410e3e385962cf77976b","observation_id":"d9ca8580-08af-4309-a510-6bc2fdc74e20","resolution":{"observed_at":"2026-08-06T22:21:09.862571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:08.482407Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.482407Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:13a5fd9fb2bef5f68589e457b17cf59f718a3bef48746925e5c4fe802d622796","observation_id":"40d011e9-9cfc-47ad-a30a-8069b912bb21","resolution":{"observed_at":"2026-08-06T22:21:08.482407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-04T10:57:26.733885Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14430","snapshot_observed_at":"2026-08-06T22:21:08.502337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.502337Z"},"links":{"cited_paper":"/paper/2405.14430","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:bd25925db4beb7683eb8eca78b41b9c9db16d8f4b219f3017244829e41fa1340","observation_id":"a0796d54-cf61-41e1-aefe-f2c49c2629a8","resolution":{"observed_at":"2026-08-06T22:21:08.502337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.665660Z","title":null,"venue":null,"work_id":"9eb104c7-099f-4089-bfd3-52750469e500","year":2022},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.511891Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:a19d1d66c4b64a73480918965ca92e0487c8016c21c29e32395c55401760f075","observation_id":"0f81eb64-e1e7-4ed4-a5e1-54e3f4ad135b","resolution":{"observed_at":"2026-08-06T22:21:09.707779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-06T22:21:08.549867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.549867Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:5c6460ae627d467f601f340656e991495b6218e2052269eb10d31d379560f80c","observation_id":"51b7d836-3419-4b09-8350-ea0d214bd869","resolution":{"observed_at":"2026-08-06T22:21:08.549867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:21:09.538121Z","title":null,"venue":null,"work_id":"0be6ebce-6fa8-45f3-8153-2fee2737f79b","year":2024},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.587759Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:812367296eba2199484fa5cdcf86a1cced4ae236347a9b794a01e2cd267e57a6","observation_id":"557c3af2-268f-4f09-8fc4-5c2d1f9749ec","resolution":{"observed_at":"2026-08-06T22:21:09.605042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-08-07T16:12:40.395721Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-08-06T22:21:08.635007Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:21:08.635007Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:19ba8616b913d2b78cc2a8662fc9ca83e90a8098c7431e4ca636f8782bac5e34","observation_id":"9b514c71-d402-45ab-9f31-d839c8a7030d","resolution":{"observed_at":"2026-08-06T22:21:08.635007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00907","last_updated":"2019-11-03T11:21:56Z","snapshot_observed_at":"2026-07-06T07:12:15.425343Z","submitted_at":"2018-11-02T14:54:50Z","title":"Importance of Search and Evaluation Strategies in Neural Dialogue Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00907","snapshot_observed_at":"2026-08-06T22:20:16.776351Z","title":"arXiv preprint arXiv:1811.00907 2 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.776351Z"},"links":{"cited_paper":"/paper/1811.00907","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:c183a917fff659b601c12b440e638fbaf89accb2d7c7fc79745643c85d53db01","observation_id":"89d81ba5-9760-4bd5-ab5c-1ec0d6815487","resolution":{"observed_at":"2026-08-06T22:20:16.776351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-06T22:20:16.448376Z","title":"arXiv preprint arXiv:1904.09751 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.448376Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:c861d3d4639c1b27bc83a1d7e2f0991f9588747b72def4cce84928c76451fb44","observation_id":"d990ec36-4a83-46ce-8f78-4998e8148b68","resolution":{"observed_at":"2026-08-06T22:20:16.448376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:20:16.951598Z","title":"In Proceedings of the 29th Symposium on Operating Systems Principles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:16.951598Z"},"links":{"citing_paper":"/paper/2506.22033"},"observation_digest":"sha256:f46a606ee4e7cee1eeb9e8dfe188a2db4dbdfa6c472376dd2b3e57a2381c2583","observation_id":"49db65b0-7641-43df-b475-86403e866d8c","resolution":{"observed_at":"2026-08-06T22:20:16.951598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22033","last_updated":"2025-06-27T09:27:04Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-08T00:15:57.810849Z","submitted_at":"2025-06-27T09:27:04Z","title":"SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.22033."}