{"as_of":"2026-08-04T09:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0143a576ed1e77981c5eec1c72b0cc74591408e8274b0fe945e9bae4638d0aa0","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:24:42.887971Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:52:43.089348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T02:12:58.334659Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"cited_work":{"arxiv_id":"2604.06664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06664","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","venue":"cs.DC","work_id":"f6681bbf-6189-4fa9-ad45-b91094f65fa3","year":2026},"citing_paper":{"arxiv_id":"2605.19481","last_updated":"2026-05-19T07:34:08Z","snapshot_observed_at":"2026-08-02T01:46:46.351301Z","submitted_at":"2026-05-19T07:34:08Z","title":"C2CServe: Leveraging NVLink-C2C for Elastic Serverless LLM Serving on MIG","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T02:10:57.582345Z"},"links":{"cited_paper":"/paper/2604.06664","citing_paper":"/paper/2605.19481"},"observation_digest":"sha256:378fd87a65f92c9f25a8f783c3e020b7c0ac205578dcbadf2fbbe5eff7c1357c","observation_id":"d036bfed-c54f-4977-9299-1608fca2e7af","resolution":{"observed_at":"2026-05-20T02:12:58.337827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06664","snapshot_observed_at":"2026-08-01T13:52:43.089348Z","title":"Morley Mao","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18957","last_updated":"2026-07-21T10:49:12Z","snapshot_observed_at":"2026-08-01T20:17:09.983307Z","submitted_at":"2026-07-21T10:49:12Z","title":"InstantInfer: Enabling Fast LLM Cold Start with Communicating Finite Automata","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:43.089348Z"},"links":{"cited_paper":"/paper/2604.06664","citing_paper":"/paper/2607.18957"},"observation_digest":"sha256:86a4df32d9906f55e61414d35fd886d186d9f343a126cbaf3a5d05e46adeede4","observation_id":"bf594ba4-f0cf-473f-9b6f-0b0cd97ea08d","resolution":{"observed_at":"2026-08-01T13:52:43.089348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.06664/citation-record","integrity":"/paper/2604.06664/integrity","json":"/paper/2604.06664/citation-record.json","paper":"/paper/2604.06664"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"83102ddc-4922-4256-8352-47fd525ea957","year":2024},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:7f758f1cde8488d44ce404e26be9eb7d0719796533ab172ceea55892d6d6df57","observation_id":"519cfe44-bf3c-467b-b820-f4e77c6ad26f","resolution":{"observed_at":"2026-05-17T03:54:00.300025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f7455543-8181-43ee-809d-40a5b23a4992","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:a795a7407cec72225eeaf361f77f68ebc6229df15f42e78cddcf129910d02b58","observation_id":"8d5fb11d-d504-4237-b058-3cec193d1766","resolution":{"observed_at":"2026-05-17T03:54:00.322432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025.Let Tensors Fly — Accelerating Large Model Weight Loading with R-Fork.https: //lmsys.org/blog/2025-12-10-rfork/","venue":null,"work_id":"2a978cfe-4dc1-4960-b829-772c5b91e523","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:175a3b7a8c165f11c647253ccd56e531e1b2c90ac29e4d905dec3fe5c62eb1ec","observation_id":"63b49a5d-b279-46c3-accc-2954e933d687","resolution":{"observed_at":"2026-05-17T03:54:00.286925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8686f5fc-8526-41c1-b1da-5ad733511bc4","year":2021},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:de5c9fc84c5dddefcde4dbaf864aff85992eba0b9cd89db84356f32df3463558","observation_id":"186aa887-d2fc-4238-8922-a969df56c673","resolution":{"observed_at":"2026-05-17T03:54:00.290459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f40eede-5de6-416f-8539-32ab6b76d30d","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:649c77965c55fd951c3cf5974da292549a227339e20367646a7e393595c614f6","observation_id":"7f56689b-cfb4-4201-8f38-a0d3cdb13556","resolution":{"observed_at":"2026-05-17T03:54:00.296869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In2023 USENIX Annual Technical Conference (USENIX ATC 23)","venue":null,"work_id":"6d452d70-67a1-4a60-acc4-f3a1b723d326","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:cbaee977e04b8a6590b47f63d205326008edd9b0a5b75f33152bb361d35b6dc0","observation_id":"c3c566b1-61cc-4bae-8ce6-3bf6b0e9c3f9","resolution":{"observed_at":"2026-05-17T03:54:00.306914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0dbcdc38-2d45-4943-b891-a6eed1a8d6c1","year":2020},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:9b244d1710466c636a5ddd568ec3249a34a60c35d719d9bba11f8420b3220c33","observation_id":"c89709f7-58e0-430d-9c5b-fe6491c37bb5","resolution":{"observed_at":"2026-05-17T03:54:00.318770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1ac99b8-86ce-4aa1-921f-6a3b21b5a6bb","year":2020},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:3886a6d44f9eaa716197bf4fe042fd6736b2ccd9ab089a19cd761b296aab484a","observation_id":"2afeb18a-cc60-449d-9053-557c4904f7b2","resolution":{"observed_at":"2026-05-17T03:54:00.303338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aca4cdce-a97c-4e19-af0f-e360657acd3f","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:a9b303a41af9888c82e4200dc8f5fc47091d1193cf490436f71bc69dc0c356a6","observation_id":"9abf8720-7ade-45d1-8233-be53d6b0f4a2","resolution":{"observed_at":"2026-05-17T03:54:00.311028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4caffb4f-8fc5-4a62-9e28-afeb389d3597","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:9dc6cc7070841590894304be6d3ef0a52f6daf2d0e93663d15aec299b5230cdb","observation_id":"20b3a2fa-b8ef-41d5-9838-23cb30cee85e","resolution":{"observed_at":"2026-05-17T03:54:00.293569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19729","last_updated":"2026-04-22T06:30:11Z","snapshot_observed_at":"2026-08-03T15:52:53.487402Z","submitted_at":"2025-09-24T03:15:37Z","title":"Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services","version":2},"cited_work":{"arxiv_id":"2509.19729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.19729","snapshot_observed_at":"2026-07-04T14:19:54.311560Z","title":"Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services","venue":"cs.DC","work_id":"cf5752f7-e18d-46db-b688-e91b777cd090","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2509.19729","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:f525c353da5f74822ed5a2262c557968881599f1ca23f23cc8d3f0de3afa77d2","observation_id":"7602c92c-29fb-4875-ab13-c97d76be6915","resolution":{"observed_at":"2026-05-11T00:41:01.512723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e7ea4285-29c8-4f5e-b8e7-d0e9adc84fe7","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:d092a3d6c3cb5151e90433c13245fe0e344bebf1ae7755296d2bd38159eaa598","observation_id":"7c6379b2-11ae-4985-81bc-0708e7c90252","resolution":{"observed_at":"2026-05-17T03:54:00.213564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"868d20cd-29ed-4be7-a006-03145e36279d","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:6b7bce59649892782231c15d57249ee223a512b0d92e086452ed19f504d544c8","observation_id":"9c01bece-c97f-476c-9a22-5099491c69f0","resolution":{"observed_at":"2026-05-17T03:54:00.177952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"55d6f18c-2876-4d94-a2ff-d8f6bcf80cee","year":2022},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:e057acdee11807d35cb3b1334784513acc147125556165aee372057ee90c1e51","observation_id":"7fd5788c-2869-4622-8af6-196ddf78a43a","resolution":{"observed_at":"2026-05-17T03:54:00.203811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0e181c26-1428-4430-903d-d6914a537147","year":2024},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:06baae1674cca204f4392a8d2e7be9527860c5cfc395eaaa806b0a5b9ebadb31","observation_id":"990cc7c3-ee5c-49a5-af6e-b7e6187f83b2","resolution":{"observed_at":"2026-05-17T03:54:00.245902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0f5fa7e7-340b-45a8-91aa-3b09c8a2665b","year":2021},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:bb5fff736e8c04b9328af0423482dcdecd13a2088dba63b26a8af0cdec2ab68f","observation_id":"705d941b-b6cb-49b2-a6dd-7c255def34c0","resolution":{"observed_at":"2026-05-17T03:54:00.218145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:03:56.534829Z","title":"Flying serving: On-the-fly parallelism switching for large language model serving.arXiv preprint arXiv:2602.22593,","venue":null,"work_id":"10a28c45-b2fa-43ae-a4d3-03bcdd13dd0c","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:55badd4060e08588c718813cf8171c41152595c6d1ad0183a76768001d11899e","observation_id":"e7c2437e-ea26-4aa6-9d8e-30c785b7d041","resolution":{"observed_at":"2026-05-11T00:41:01.387653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1c719ba-0483-49e0-99dd-b62091e468e4","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:5368bf8f90119d7767f97199b6ea5735a93ef5a09dabec4b783dfbe2d7cc98a2","observation_id":"7ccd7787-6ea0-44e0-9b8a-5bed3c491658","resolution":{"observed_at":"2026-05-17T03:54:00.239430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In2018 IEEE International Conference on Cluster Computing (CLUSTER)","venue":null,"work_id":"3316ffa3-7b2c-4d82-a719-50134b2baebd","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:10b52471d722458119e2c1b8a5149680fad79bd639da73f5d53d3027b696d127","observation_id":"d9f5e39f-d63c-4cf2-9da8-c8c61cdfffd0","resolution":{"observed_at":"2026-05-17T03:54:00.282990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:34893b4c28147f7cc9347693af8b71e093e22d01b46a89e3abd0c81ad54c6cdb","observation_id":"92431362-0309-4381-bdb7-5a890f3f554f","resolution":{"observed_at":"2026-05-11T00:41:01.572787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21892","last_updated":"2026-05-11T14:39:18Z","snapshot_observed_at":"2026-08-02T19:46:17.700307Z","submitted_at":"2025-09-26T05:29:19Z","title":"Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":"2509.21892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.21892","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts","venue":"cs.CL","work_id":"063f69cd-20e7-429c-8709-e3afebcfbfd9","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2509.21892","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:a88c0da5abf4b4cf903f0ca7cc75edc520576fcf0b618459ed19a82822c41d81","observation_id":"4689a1a8-540e-454a-b67f-5594342f0897","resolution":{"observed_at":"2026-05-12T03:42:01.775082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"04aec2ac-79ac-4d91-95ca-94b44d75cf2c","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:7708d9d6fa7ce4ba0480499509e330f6ceb815301072b358464a788ee32dcf01","observation_id":"7b309813-33be-4dcf-a8d1-deaab7673ca4","resolution":{"observed_at":"2026-05-17T03:54:00.158879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"804e85cf-37ab-4f96-82dc-d8e41f3b75a2","year":2020},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:7c9b9462aef35684d7c06498b0e491de4378d61aca437612e3455ca3ce737840","observation_id":"68e6cee9-7bae-4b04-89a8-2c71685a1b7d","resolution":{"observed_at":"2026-05-17T03:54:00.242653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:3e0c66f43bafd00a4dbafabd7b4e0ac00474390a62f426fce6f5e7a10201ec4a","observation_id":"9006a53b-4ca8-4a2f-a9e0-a34da324770f","resolution":{"observed_at":"2026-05-11T00:41:01.567245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7ef28ca6-7ac1-482b-8f29-56d4b95a5b86","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:45b09421c788f2d025fc8f66bb0058d982bc1fd937f6ec81e0b9e910784e2959","observation_id":"1e425e3c-d96a-4636-be7a-791bc5522ade","resolution":{"observed_at":"2026-05-17T03:54:00.188201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:21:59.375952Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"576d056a-17a3-4f5a-a728-be1d2a281d08","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:5c6a5fb88a8337c3017740089bfae15195aa29ad50699185fa07885b0e1cc560","observation_id":"ce5e41f3-48ff-4017-9b8a-fe54742cd04b","resolution":{"observed_at":"2026-05-17T03:54:00.200222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.36131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:46.538457Z","title":"In Proceedings of the 29th Symposium on Operating Systems Principles (SOSP ’23)","venue":null,"work_id":"4b81c090-6653-47cc-bb14-702c66f2862b","year":2023},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:1adc88782aaa69bff69a829ab1218e11334358cd268048e20cba5bc73d45a98d","observation_id":"38f53fd8-803c-48d5-bf93-ec36b1a46d89","resolution":{"observed_at":"2026-05-11T00:41:01.769468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"77fbd930-cf4b-4182-9483-d62a1987da50","year":2021},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:e6dc165035c4b872956f668be040665bed96c263fea3aa9231784b5d169c1b7f","observation_id":"1c09efa7-efda-4364-87c7-bc22f61d0033","resolution":{"observed_at":"2026-05-17T03:54:00.257482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:39:46.790875Z","title":"2025.Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving","venue":null,"work_id":"b7454bc5-a9da-483c-9bc5-fe9e7b5383af","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:8af10953722abb86ec382ff5413193be4c10fe9a8281cf044604b37982ddc638","observation_id":"b9cfe369-cf68-4f08-8169-c6797cc53325","resolution":{"observed_at":"2026-05-11T00:41:01.620019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fe56968f-aefd-40b5-942c-8178178bb671","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:07ba991997944bbe662b796f881a5a6c3571eb1550e4553524f6b9ffc3ea897f","observation_id":"8690f2af-ff41-4dd8-af9a-0d0249c9f330","resolution":{"observed_at":"2026-05-17T03:54:00.232207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09472","last_updated":"2026-05-21T07:26:42Z","snapshot_observed_at":"2026-08-01T16:50:48.022324Z","submitted_at":"2025-12-10T09:47:40Z","title":"WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving","version":2},"cited_work":{"arxiv_id":"2512.09472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.09472","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WarmServe: Enabling one-for-many GPU prewarming for multi-LLM serving","venue":null,"work_id":"91daca5c-e40a-4d8b-bc2e-adde75fd7fde","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2512.09472","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:127f31f41244333bf632ff6690df1a204945774f638318b8c6d84e77f4c306e5","observation_id":"4b76ed9b-46e7-4196-bd54-4b0b51d2cef8","resolution":{"observed_at":"2026-05-22T02:03:52.823910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e9873de1-f24a-49e6-ae1e-6546d3ac409a","year":2023},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:bcdde8704b4e77cb12e69b810a24d190103a40671035142db1d1963f870cb98e","observation_id":"7a1ca8c5-1ac7-4c92-809d-de4ec042e2d9","resolution":{"observed_at":"2026-05-17T03:54:00.264987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVIDIA.https://docs .nvidia.com/cuda/cuda-driver- api/group__CUDA__GRAPH.htmlAccessed March 5","venue":null,"work_id":"fde5bbf3-ee75-4aee-872e-6472eb1cbc29","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:9f4dba8b413a767f4381d73b8d3a902ed3dbb1c00d3cc29888d60ba04340c921","observation_id":"0e79af0d-79e8-4159-a2e7-28e61f98c845","resolution":{"observed_at":"2026-05-17T03:54:00.272827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026.NCCL: Optimized primitives for inter-GPU communica- tion.https://github.com/NVIDIA/nccl","venue":null,"work_id":"e86111f8-de07-471f-86f2-bec160f34061","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:794edd45864e445b57333c2638dc7fb57181cfd7bc6144750ef624643a32a9a8","observation_id":"f3befc6f-a929-4e44-a59c-bbc3eae0895e","resolution":{"observed_at":"2026-05-17T03:54:00.196143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026.NVSHMEM: The NVIDIA SHMEM library for GPU clusters.https://github.com/NVIDIA/nvshmem","venue":null,"work_id":"34f91064-e4b0-4928-bc8c-735de488c101","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:d83aa6f35bb0516920279e79f3312f173cd03a6ff5cb7e7cd1d8d8ee3267caf4","observation_id":"1474ef13-4aca-4613-ae0e-b445a0c1a69f","resolution":{"observed_at":"2026-05-17T03:54:00.209149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5be4e470-db84-467a-8975-e38016f621d1","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:ee15682e98f3c068286d557a335ec537cc168261b365562c9babbe736e93883a","observation_id":"c809b55c-65f9-4a96-8edc-bf690e0605c4","resolution":{"observed_at":"2026-05-17T03:54:00.181278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025.Weight Transfer for RL Post-Training in under 2 seconds.https://research .perplexity.ai/articles/weight-transfer-for- rl-post-training-in-under-2-seconds 13","venue":null,"work_id":"7cfbc78c-87c1-4d89-b168-dff742e17ab2","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:778db95bd57881abc67f4e5bc1acfd3bd1f18c24557290d7116a8a8b331802b7","observation_id":"f02537f4-b941-40d2-9884-60ba5cbf0fe1","resolution":{"observed_at":"2026-05-17T03:54:00.224870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9940.370725","doi":"10.1145/3669940.3707251","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention,","venue":null,"work_id":"825c9c19-13d7-4b91-9c6b-8c2d1b6c90c7","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:cf3bcbbcd65343389d97ba8205dc04c1e95fc9151ebdefc2d458a7925e799a52","observation_id":"846ebf8b-b70c-4221-848d-b15cd88445c1","resolution":{"observed_at":"2026-05-10T18:25:42.224988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"62d39674-441e-4687-8b62-971229f0d5d5","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:164332637b2be563d15610a22090273569514948cad19bbfe9c72718914d79fd","observation_id":"3e5ec513-48a4-42b8-8eb0-94724751e168","resolution":{"observed_at":"2026-05-17T03:54:00.235508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01228","last_updated":"2025-09-03T20:54:57Z","snapshot_observed_at":"2026-07-06T19:25:42.156795Z","submitted_at":"2024-10-02T04:12:13Z","title":"ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving","version":2},"cited_work":{"arxiv_id":"2410.01228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01228","snapshot_observed_at":"2026-07-02T15:27:06.032587Z","title":"Gon- zalez, Ion Stoica, and Harry Xu","venue":null,"work_id":"8267ce10-9156-4dba-a201-7567a179fc73","year":2024},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2410.01228","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:f6392c06e573c7c44b5e1c8a630ee3ceb71276ef021f668e135e1b048c9c5f90","observation_id":"8023bd15-7971-4431-81cc-67daf1548ef8","resolution":{"observed_at":"2026-05-11T00:41:01.482759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"787cd7b1-5d65-44a2-ad56-c0ee6f87496a","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:1fff0812fde38fb61bea2481fce935e86db2288fc699c684594bb40f88565e9f","observation_id":"5746d400-1a22-4aee-9149-f9f9cb639847","resolution":{"observed_at":"2026-05-17T03:54:00.221305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ca25153-f63c-4e39-a80d-8edb287feded","year":2022},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:1f329be96375bc51b415f3f180b999fcfb660c412684a6cc3bf3075fe55a2cdc","observation_id":"73c1365c-f44f-49ba-b087-b1f4766ba024","resolution":{"observed_at":"2026-05-17T03:54:00.162495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16631","last_updated":"2025-02-23T16:14:52Z","snapshot_observed_at":"2026-07-06T20:41:14.989836Z","submitted_at":"2025-02-23T16:14:52Z","title":"CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads","version":1},"cited_work":{"arxiv_id":"2502.16631","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.16631","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1960d124-9c16-4040-bbe6-fd8e7cd466a2","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2502.16631","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:f2a797088607a2d554d0f13245323022c1148111f2e25a5e9e16b9b72450e25a","observation_id":"c7d3d83b-52ad-499c-ac98-aec12e62e2ae","resolution":{"observed_at":"2026-05-11T00:41:01.675221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3345d05e-5b9d-4ff7-bb71-e72af0efa72d","year":2024},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:6968feddc39cf9f9f48ab491ca1a06df907c24858a5dc717a0554d3706cff336","observation_id":"8ef62e13-4beb-40ae-933d-0062e009a5a3","resolution":{"observed_at":"2026-05-17T03:54:00.228620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6bd2519c-65d7-4587-b303-9df66e715a6d","year":2009},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:065836096dc65f1c641a1e1731a89339edd5f88fb8e87e6e433a72e9db6322a0","observation_id":"1b84e5cf-4996-45c1-85db-43c1edc0481e","resolution":{"observed_at":"2026-05-17T03:54:00.174512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026.Elastic EP in SGLang: Achieving Partial Failure Tolerance for DeepSeek MoE Deploy- ments.https://www .lmsys.org/blog/2026-03-25-eep-partial-failure- tolerance/","venue":null,"work_id":"338e2151-08e2-4157-bd37-4be909d4b903","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:f924475a80f00cd33e842fe94621c841e0c4bf53ca3a5d685d0e8c42d862b21c","observation_id":"d4ec762d-a45b-4be9-8994-4857cfb3603f","resolution":{"observed_at":"2026-05-17T03:54:00.269134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ae1a3285-8890-4d37-add5-e09bc79688c7","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:8b1f66b039544ed4d7d80727ed7546b5c7d77e5f9ca5798375d0db1643a1962e","observation_id":"676db65c-613c-4a2e-8780-be8b4f148866","resolution":{"observed_at":"2026-05-17T03:54:00.276313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"14da5795-bff8-4057-b558-bfc816e8afc1","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:c2ec7761f3aed70f096c1ce072c450b6c80adceb48b88364ed786702cb20d27e","observation_id":"641a95e8-8605-4104-b286-61800c8a5e65","resolution":{"observed_at":"2026-05-17T03:54:00.279265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1569.376481","doi":"10.1145/3731569.3764810","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Aegaeon: Effective gpu pooling for concurrent llm serving on the market","venue":null,"work_id":"bcb0b297-69ef-45fb-96b9-add34313508c","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:c940bff27f67a5b6a480b0773f9dded91be7ba35f1362d855055f34e03763722","observation_id":"7b005a35-8f36-439f-8299-860dd4056bba","resolution":{"observed_at":"2026-05-10T18:25:42.220672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f483cd4a-69e3-4946-a10b-f3732b76ad6d","year":2024},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:b26e7d7eb014f5df07ff6fd1dfabb21882b99e56287b0263ac6572221a2adb4c","observation_id":"30824795-e557-48e9-b1c5-b104a954eaf1","resolution":{"observed_at":"2026-05-17T03:54:00.261540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:da7624c4030f1fc8e2ef8c941ccd86e23560ff8db25a8ddba839c9711cdf16df","observation_id":"6bbe1455-bc65-43fb-98c7-76990269a634","resolution":{"observed_at":"2026-05-11T00:41:01.502719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.09922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lambdas- cale: Enabling fast scaling for serverless large language model inference","venue":null,"work_id":"cf2e378f-e444-4d62-98ef-e22b591f4962","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:c1907240fced12cb5abef25b5315bbcef562aec569b552b4072f70624e1ead8c","observation_id":"4ce7ae01-0e8e-4f79-9dc1-1d343ee9bce2","resolution":{"observed_at":"2026-05-11T00:41:01.236616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04021","last_updated":"2026-06-10T23:04:53Z","snapshot_observed_at":"2026-07-06T21:20:03.311226Z","submitted_at":"2025-05-06T23:38:33Z","title":"Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning","version":3},"cited_work":{"arxiv_id":"2505.04021","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04021","snapshot_observed_at":"2026-07-03T17:18:43.284498Z","title":"Prism: Unleashing gpu sharing for cost-efficient multi- llm serving","venue":"cs.DC","work_id":"b06d977c-d2bf-4367-bdeb-cd88d2f6fa4f","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"cited_paper":"/paper/2505.04021","citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:d7b5575228f6e82ff89a27c3fadbd22e7f965e3753a4043bfe58cc9897a8ed58","observation_id":"a346645f-8653-4794-a46d-c1e1bab47eb4","resolution":{"observed_at":"2026-06-12T02:08:18.534775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a2729dc-1e79-45da-aa3c-713dea7adcf7","year":2026},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:057fe478b45b220b522bf211c8c0a293d4b0dd3493aef3b1340536264d768bf2","observation_id":"56c8730f-71af-4b94-bb1d-fc5bbf8bf3ef","resolution":{"observed_at":"2026-05-17T03:54:00.250538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9940.370728","doi":"10.1145/3669940.3707280","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":null,"venue":null,"work_id":"6957b4a8-bee6-41f3-809e-328d5bc5ef2e","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:1f2b879255561b33bce606cf503100aa8d214dff9e29bd8e4f7a5c7291199250","observation_id":"becdce75-5260-41e4-8e72-9db465b26e60","resolution":{"observed_at":"2026-05-10T18:25:42.216438Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc88c1d8-b15a-4400-8e38-fe0d537c675c","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:54e8f70a36d4df125b642e8d1212c54f99be9507f02c73a854c8e0df29f3b217","observation_id":"4dc64771-106b-40be-b9b6-15cfe5311fb7","resolution":{"observed_at":"2026-05-17T03:54:00.191775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c499cc4e-d245-4da1-8258-46d992f44948","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:4a083ecd8a8d893c1ded5acaeacce36f407cdfdf2621d778b608285d832569ed","observation_id":"e6290f43-6bdc-4bd1-8821-8821b73447f7","resolution":{"observed_at":"2026-05-17T03:54:00.166212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e3e624fa-2d57-4986-b338-9ffda603b8ec","year":2024},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:83ad1dfa1bf5a2ce5fda5fe575d233d859e79f9c4834ff288ffef37726b97dac","observation_id":"81b70ee4-afb9-4d47-9c30-afa191e090ef","resolution":{"observed_at":"2026-05-17T03:54:00.169841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"47e81abc-8cdc-4a6e-b912-558c0fe42a20","year":null},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:1ae36871f4ccc435dc4245d7f818e24bfd2954ea8b1009fde1dd1593644b655a","observation_id":"b36572a8-67f5-488c-8bf0-c51eda5febf9","resolution":{"observed_at":"2026-05-17T03:54:00.184683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8feecd22-ca3a-45d9-bfbb-4c601fcf582b","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:f99f050ee7ca77a6c044c0fc924006c4f073196171643ca4a5d78348fc05a071","observation_id":"c279c4d6-7aa4-431f-a765-a64b3403e2f2","resolution":{"observed_at":"2026-05-11T00:41:01.494180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"id\": 7","venue":null,"work_id":"935df25c-b44d-4b75-8b39-f51bfa795faf","year":2025},"citing_paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:42.887971Z"},"links":{"citing_paper":"/paper/2604.06664"},"observation_digest":"sha256:6c98666a3ebcf597928cb12f78a9f3bf063d0ba497b5ace5b3eef4fb79eae452","observation_id":"ec0b2086-aab8-445c-8071-d1c8385d7ad9","resolution":{"observed_at":"2026-05-17T03:54:00.253918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.06664","last_updated":"2026-04-08T04:31:34Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-03T07:58:59.160028Z","submitted_at":"2026-04-08T04:31:34Z","title":"Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":34,"verified_exact":13,"verified_fuzzy":10},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2604.06664."}