{"as_of":"2026-08-06T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0a22e65c772799b2797e764163b46d63a0349ec1093bf5c3b953844a8a102d0","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T08:20:01.011625Z","state":"measured"},{"denominator":162,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":162,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":127,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:10:17.620377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":10,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:03296fb31f2067c43506e9e2f350bd43fb0bbe88c5ed9a58073ff82b70570164","observation_id":"d65f1508-ed36-4284-a44a-59fa6e2af223","resolution":{"observed_at":"2026-05-15T02:39:33.414625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:4830b6af2025ac4edd0818eee6c6489eeeb9d9b4f0f08e6bc1c369e0523b972f","observation_id":"c34b8ce4-76bf-4cc0-b6fe-4eca1d791962","resolution":{"observed_at":"2026-05-17T11:16:32.126000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T04:42:23.297389Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2407.21787"},"observation_digest":"sha256:485c5ee87b0ceebee646a8e5013737977cbff235d99666954ec466cfe88d3a61","observation_id":"2611a68e-8f2e-4ccf-8031-76d4f7472c8f","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":222,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:4600dac023bc8fb6ac6763267bc6f54cc0c8a0ec34450f1aec550ef73e14221b","observation_id":"69661b31-10ff-46b6-bc7c-c34df8a156de","resolution":{"observed_at":"2026-05-23T17:35:43.579524Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T13:26:34.747336Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2501.01005"},"observation_digest":"sha256:1cc037442b6a8dc7456e16b3c06a68eed4d784a313cd285af6daa761de92617b","observation_id":"1b756769-b3f8-4ab6-aac6-c6f91020a592","resolution":{"observed_at":"2026-05-16T13:26:34.815784Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2504.09775","last_updated":"2026-04-20T20:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T00:29:49Z","title":"MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference","version":6},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-22T21:16:31.655330Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2504.09775"},"observation_digest":"sha256:0ee4a7ab40504b574c4f89fe43d84125b18384cdb3be65e78a66c7149e6544d5","observation_id":"4fad1018-e2de-4510-be2b-8afa984b15a2","resolution":{"observed_at":"2026-05-22T21:17:07.965750Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2505.09999","last_updated":"2026-05-11T03:41:00Z","snapshot_observed_at":"2026-07-30T05:05:51.180006Z","submitted_at":"2025-05-15T06:24:08Z","title":"ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T15:42:05.266854Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2505.09999"},"observation_digest":"sha256:4ea10d9d550c2dd2f1ee6e1b22d5e94c112092f0af1ed25a92621aa28204282a","observation_id":"ec42c426-1a3b-4ee4-a42c-26f989f42211","resolution":{"observed_at":"2026-05-22T15:44:58.129988Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T22:10:17.620377Z","title":", Yin, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07571","last_updated":"2025-08-19T11:54:07Z","snapshot_observed_at":"2026-08-05T22:10:14.525356Z","submitted_at":"2025-08-11T03:05:36Z","title":"Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T22:10:17.620377Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2508.07571"},"observation_digest":"sha256:5c361b146005c84b2b0617c01f853a55b9c47fd9df3c625ee889ac2e73935488","observation_id":"a7d87f7c-0abc-44f7-b79e-63433b63ff43","resolution":{"observed_at":"2026-08-05T22:10:17.620377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T16:32:54.657298Z","title":"SGLang: Ef- ficient Execution of Structured Language Model Programs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18255","last_updated":"2025-09-02T17:12:12Z","snapshot_observed_at":"2026-08-05T16:32:51.675767Z","submitted_at":"2025-08-25T17:45:06Z","title":"Hermes 4 Technical Report","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T16:32:54.657298Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2508.18255"},"observation_digest":"sha256:485594b0c66c74177f595f08063555da1fef509795bf4cd34f495dd2019d624b","observation_id":"3ebf05aa-7325-4941-b15a-c360b46e99c5","resolution":{"observed_at":"2026-08-05T16:32:54.657298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T11:30:02.319006Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02751","last_updated":"2025-09-02T18:59:15Z","snapshot_observed_at":"2026-08-05T11:30:01.655498Z","submitted_at":"2025-09-02T18:59:15Z","title":"Deep Research is the New Analytics System: Towards Building the Runtime for AI-Driven Analytics","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T11:30:02.319006Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2509.02751"},"observation_digest":"sha256:659ac9a312a9d6fc48b748a0615a5ebd8c6c798ce863e97748624f4254bf344f","observation_id":"403bab14-b320-418e-8c40-0c84715ee33a","resolution":{"observed_at":"2026-08-05T11:30:02.319006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-04T18:58:13.051506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09560","last_updated":"2025-09-11T15:51:43Z","snapshot_observed_at":"2026-08-04T18:58:09.658832Z","submitted_at":"2025-09-11T15:51:43Z","title":"Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:13.051506Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2509.09560"},"observation_digest":"sha256:78b4d83a8d74fcbc1a642f8cf9a73ad7d91d3fb685a51f4477925c549984cb32","observation_id":"c11e8fe6-25f0-43d0-9d44-4fe37e879ddd","resolution":{"observed_at":"2026-08-04T18:58:13.051506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2510.10129","last_updated":"2026-05-21T08:20:19Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T09:28:26Z","title":"CacheClip: Accelerating RAG with Effective KV Cache Reuse","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T12:36:41.630618Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2510.10129"},"observation_digest":"sha256:cf3ec176a9b9dce275cf05f6b87e9985be56e59b7c48fde51ea395b8ea68facd","observation_id":"496c1c4f-4c06-4eaa-8077-690f696a7307","resolution":{"observed_at":"2026-05-22T12:41:33.796275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2510.19669","last_updated":"2026-05-08T14:25:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T15:16:06Z","title":"DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T04:31:40.360872Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2510.19669"},"observation_digest":"sha256:6530308ad47d787a82b663b7bb2547f5c0b519cc868da277d5e4d0cc3cf48a41","observation_id":"2d2e4ea5-9283-43a2-a1a0-ad804922f90c","resolution":{"observed_at":"2026-05-18T04:32:23.059538Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:6dbb5f1f50bbccdc9a30e6055106195453f4520a4ac5f518cf46d77f21e4d498","observation_id":"a713be5b-4cec-48fd-b760-e990a3df4b86","resolution":{"observed_at":"2026-05-18T02:00:39.397829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2511.21686","last_updated":"2026-04-18T01:35:07Z","snapshot_observed_at":"2026-08-01T03:26:40.746820Z","submitted_at":"2025-11-26T18:59:28Z","title":"Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T04:23:03.393566Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2511.21686"},"observation_digest":"sha256:b3497ac7330cee6565f69ff75e339e7fddf8eaa828d7a674873d07d0564d022d","observation_id":"9810cff1-4b96-47b4-9d9d-6f7b22f0db94","resolution":{"observed_at":"2026-05-17T04:24:00.343515Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2512.14098","last_updated":"2026-04-15T20:49:22Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T05:14:41Z","title":"Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:48.239186Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2512.14098"},"observation_digest":"sha256:f8aa08536d4bdbe7c4e1324d404bf068d936734a75af421392a3199b42bf9ecc","observation_id":"9b06a2ab-482a-481d-9eb2-7c1c7a9ee975","resolution":{"observed_at":"2026-05-16T22:21:18.696657Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-03T13:48:01.890708Z","title":"Gonzalez, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23075","last_updated":"2026-06-26T02:45:25Z","snapshot_observed_at":"2026-08-03T17:03:53.187665Z","submitted_at":"2025-12-28T20:41:59Z","title":"Trust Region Masking for Long-Horizon LLM Reinforcement Learning","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T13:48:01.890708Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2512.23075"},"observation_digest":"sha256:9c005a18c165823a9da20f2c0bb3f3f794d765b088230cec1b1606df595c6c52","observation_id":"2ed898ed-3df2-4af9-8e02-a7ca12b3ed72","resolution":{"observed_at":"2026-08-03T13:48:01.890708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-03T12:07:34.766774Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04426","last_updated":"2026-08-05T15:35:29Z","snapshot_observed_at":"2026-08-06T06:26:42.658385Z","submitted_at":"2026-01-07T22:18:51Z","title":"XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T12:07:34.766774Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2601.04426"},"observation_digest":"sha256:4058603024a37a7e5c4caeeb649b0f48a5bf192aec3d200fe11a479cd8e0328a","observation_id":"53b80fe2-8206-4506-8f36-e2330aecb0f6","resolution":{"observed_at":"2026-08-03T12:07:34.766774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2601.12967","last_updated":"2026-04-22T09:04:03Z","snapshot_observed_at":"2026-08-02T05:54:03.620352Z","submitted_at":"2026-01-19T11:26:49Z","title":"Sutradhara: An Intelligent Orchestrator-Engine Co-design for Tool-based Agentic Inference","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T13:23:16.969774Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2601.12967"},"observation_digest":"sha256:c1a22e58295c214306a3ab978439d9bd2ffb39076583ede280bdbef25525fb21","observation_id":"4e83e2a4-75d9-405d-af51-6fd6f86898b4","resolution":{"observed_at":"2026-05-16T13:27:55.914398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-03T00:06:25.206499Z","title":"H., Cao, S., Koonce, C., Cheng, J., Gonzalez, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11688","last_updated":"2026-07-29T19:22:20Z","snapshot_observed_at":"2026-08-03T00:06:24.165526Z","submitted_at":"2026-02-12T08:09:14Z","title":"GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T00:06:25.206499Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2602.11688"},"observation_digest":"sha256:d8d67696846346ce2a21b2ebcc8324f74460a70a7d98badb81585ad7cbc3b4a8","observation_id":"089459dc-6f11-4905-bada-132ad7b20679","resolution":{"observed_at":"2026-08-03T00:06:25.206499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-02T23:32:15.224685Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.13692","last_updated":"2026-06-30T17:19:18Z","snapshot_observed_at":"2026-08-02T23:32:10.162628Z","submitted_at":"2026-02-14T09:26:41Z","title":"ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T23:32:15.224685Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2602.13692"},"observation_digest":"sha256:2e87d8ff1670c5a544cd4813d67db9334088cb677066e2aa072054889232cfc9","observation_id":"0798b9c7-430c-4aa0-9cbc-93e281776b1e","resolution":{"observed_at":"2026-08-02T23:32:15.224685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2603.28342","last_updated":"2026-04-23T09:14:32Z","snapshot_observed_at":"2026-08-02T23:18:14.887276Z","submitted_at":"2026-03-30T12:12:49Z","title":"Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T22:17:13.431164Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2603.28342"},"observation_digest":"sha256:6dff06d8c6a4fc2734abb04ee7b3135cffc2abbb3b0174e997ce11ce87644582","observation_id":"5860a4ef-4582-4754-ad0b-b8ad3d42278e","resolution":{"observed_at":"2026-05-14T22:18:04.293566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.03270","last_updated":"2026-03-22T11:55:09Z","snapshot_observed_at":"2026-08-02T07:26:08.191735Z","submitted_at":"2026-03-22T11:55:09Z","title":"Knowledge Packs: Zero-Token Knowledge Delivery via KV Cache Injection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T07:11:13.865969Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.03270"},"observation_digest":"sha256:a755200a1a7df9316395abb967a9753aa504d82f1061398ad8af28e299c8b8d1","observation_id":"a9b69302-04e4-41e5-8070-6a5ff93f2c06","resolution":{"observed_at":"2026-05-15T07:15:12.068501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.09557","last_updated":"2026-05-28T14:40:40Z","snapshot_observed_at":"2026-08-03T16:37:32.743096Z","submitted_at":"2026-02-10T16:19:56Z","title":"SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T03:13:37.202362Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.09557"},"observation_digest":"sha256:6ffe0c57c7b1623ecad18121d69aa61ca6bb0757c16f7a3aa645e50e1515cc96","observation_id":"a31155bc-1873-4467-bb67-ac2813eea3a0","resolution":{"observed_at":"2026-05-16T03:17:12.246827Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-03T02:40:59.456464Z","title":"L., Huang, J., Yu, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.09557","last_updated":"2026-05-28T14:40:40Z","snapshot_observed_at":"2026-08-03T16:37:32.743096Z","submitted_at":"2026-02-10T16:19:56Z","title":"SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T02:40:59.456464Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.09557"},"observation_digest":"sha256:4c3d4cac912b5d8883a16744730af6b4a602c9cc9a09acbd7a379a5636da4e57","observation_id":"8583487d-5047-4bb3-88b7-c142ed5f2737","resolution":{"observed_at":"2026-08-03T02:40:59.456464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.09852","last_updated":"2026-04-10T19:30:29Z","snapshot_observed_at":"2026-07-06T22:58:38.807460Z","submitted_at":"2026-04-10T19:30:29Z","title":"MEMENTO: Teaching LLMs to Manage Their Own Context","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T17:16:36.784237Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.09852"},"observation_digest":"sha256:894af912c434dcd38e20168f6cf81f3671f1779f695c57c9a894922332049b99","observation_id":"1b28353f-f5b0-4002-b37d-a61a505906d6","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.10235","last_updated":"2026-04-11T14:38:11Z","snapshot_observed_at":"2026-08-02T23:47:42.583705Z","submitted_at":"2026-04-11T14:38:11Z","title":"CodeComp: Structural KV Cache Compression for Agentic Coding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:44.149481Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.10235"},"observation_digest":"sha256:ba0fd0a1e7d2fa7729593b317192eea3aab3d92f37200cc8b2051a2226a46483","observation_id":"dc9a5121-b1e8-44ef-be3a-2fd6f7c83ed8","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:46c7f75c60d16c2e69745cb0bb2e784af4deae786f2e72ecb763cd9eed1648a6","observation_id":"e29febe5-7e34-4270-a0c3-f8dbc3898095","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.11943","last_updated":"2026-07-06T04:35:13Z","snapshot_observed_at":"2026-07-12T21:41:19.909380Z","submitted_at":"2026-04-13T18:32:02Z","title":"ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:18.594869Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.11943"},"observation_digest":"sha256:cdfec4e839b18d9c26dd6a27a6075b019f51b5c57771e284c4035714a6994824","observation_id":"a753f19f-1917-4b37-8513-bfe471f63066","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.14847","last_updated":"2026-04-16T10:33:00Z","snapshot_observed_at":"2026-07-06T23:02:31.717911Z","submitted_at":"2026-04-16T10:33:00Z","title":"TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T11:45:07.257159Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.14847"},"observation_digest":"sha256:81d5f27acb1de44cc7f6fa9a97b60d5732d23f4d1b49bfe0114639992756047a","observation_id":"f9994de8-27e4-4ba1-838d-5ea605b04250","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.15379","last_updated":"2026-04-15T21:49:03Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-15T21:49:03Z","title":"Fleet: Hierarchical Task-based Abstraction for Megakernels on Multi-Die GPUs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T11:35:58.213556Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.15379"},"observation_digest":"sha256:2649d26f5f1f769aeb20762610615545b0b9e4bdc68ef32995278c429b7651c3","observation_id":"d3b18b48-1254-4a5d-a25a-529de8129fd7","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.16736","last_updated":"2026-04-17T22:48:23Z","snapshot_observed_at":"2026-07-06T23:04:01.558812Z","submitted_at":"2026-04-17T22:48:23Z","title":"When Agents Go Quiet: Output Generation Capacity and Format-Cost Separation for LLM Document Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T07:50:54.128824Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.16736"},"observation_digest":"sha256:0ef08b097b10ae04c6249d553116c3efb91a8fbd8b2a6762172f94ece9361f22","observation_id":"7fff1fc6-8867-4895-a2f6-03f312d6bdb6","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.16838","last_updated":"2026-05-10T16:22:59Z","snapshot_observed_at":"2026-08-03T04:41:01.774350Z","submitted_at":"2026-04-18T05:10:11Z","title":"enclawed: A Configurable, Sector-Neutral Hardening Framework for Single-User AI Assistant Gateways","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T07:11:06.389107Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.16838"},"observation_digest":"sha256:46e07d95ff278c2c652d078a272d67153249309344146d9a32666ad98b85fba4","observation_id":"c12f2007-9cf2-4714-83c0-83c01da4da5e","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.16838","last_updated":"2026-05-10T16:22:59Z","snapshot_observed_at":"2026-08-03T04:41:01.774350Z","submitted_at":"2026-04-18T05:10:11Z","title":"enclawed: A Configurable, Sector-Neutral Hardening Framework for Single-User AI Assistant Gateways","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:50:36.175721Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.16838"},"observation_digest":"sha256:63294a1da5687de6c583b9f8997fb78608c793ee986337c17d7279a5172b02d3","observation_id":"fa6e9a18-a6fd-4710-97ba-828e14b38205","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.16864","last_updated":"2026-04-18T06:28:21Z","snapshot_observed_at":"2026-08-02T05:52:50.560554Z","submitted_at":"2026-04-18T06:28:21Z","title":"HieraSparse: Hierarchical Semi-Structured Sparse KV Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:19.184970Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.16864"},"observation_digest":"sha256:449a24315bacf2ff6a473f2252058852fd7ef3e2699b8449c95bd2cd315189b4","observation_id":"6e24beab-0a2f-488f-81ce-33a052b932af","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.20560","last_updated":"2026-04-22T13:42:00Z","snapshot_observed_at":"2026-07-06T23:07:03.254122Z","submitted_at":"2026-04-22T13:42:00Z","title":"LLM StructCore: Schema-Guided Reasoning Condensation and Deterministic Compilation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T23:43:22.473104Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.20560"},"observation_digest":"sha256:1e9d809bd00d62a2a1c85e044b5a69e4fd60878b5e1e7109c80ffcb9d67d6731","observation_id":"3212af09-1c2c-4a0e-b030-0fbd6925d848","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.25724","last_updated":"2026-04-28T14:53:11Z","snapshot_observed_at":"2026-08-01T04:26:55.744819Z","submitted_at":"2026-04-28T14:53:11Z","title":"Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T16:19:35.815472Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.25724"},"observation_digest":"sha256:c81fc5cc9b5c6f751788b6e7c5fae92e1fc85562f9c407af256f20ea44bfa5a3","observation_id":"92f9ecf4-7edd-4ae6-8b4f-ce6037819f62","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.26039","last_updated":"2026-04-28T18:20:12Z","snapshot_observed_at":"2026-07-06T23:11:48.524898Z","submitted_at":"2026-04-28T18:20:12Z","title":"RaMP: Runtime-Aware Megakernel Polymorphism for Mixture-of-Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T16:39:35.128879Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.26039"},"observation_digest":"sha256:e7934af2f43d5863b3ac5f8bf83d5152bd6ad803bf8312c49cf66059a05d5cbb","observation_id":"3ebbbd2b-962b-419c-88b9-dd31f90b1926","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.27476","last_updated":"2026-06-08T07:15:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:18:50Z","title":"EdgeFM: Efficient Edge Inference for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T08:30:35.264804Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.27476"},"observation_digest":"sha256:cd2b3a5b13743b15c8aa6fa3bfd4113f3008573ada3fb0fc2995002a89bb0317","observation_id":"88acee04-583d-4909-b9fb-572ad13a5c49","resolution":{"observed_at":"2026-05-12T10:01:27.694910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2604.27476","last_updated":"2026-06-08T07:15:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:18:50Z","title":"EdgeFM: Efficient Edge Inference for Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T08:54:41.845820Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2604.27476"},"observation_digest":"sha256:13df0061ce5e18fa8afd6bbb98f637dc85a9679f1a878a700805cf0b2d7fadf3","observation_id":"db2e29a4-53d6-4d7c-871b-ede04c5fac02","resolution":{"observed_at":"2026-07-01T08:55:34.747200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.01060","last_updated":"2026-05-01T19:51:50Z","snapshot_observed_at":"2026-07-06T23:14:20.123289Z","submitted_at":"2026-05-01T19:51:50Z","title":"SURGE: SuperBatch Unified Resource-efficient GPU Encoding for Heterogeneous Partitioned Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-09T18:16:03.307938Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.01060"},"observation_digest":"sha256:12f683377fc7a370256a869aa106a4853c55cf1318963252011164eacd2e9a00","observation_id":"1bc78a40-bdc5-4dfa-9653-382725e49b8e","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.02821","last_updated":"2026-05-07T06:51:57Z","snapshot_observed_at":"2026-08-02T11:27:54.086295Z","submitted_at":"2026-05-04T16:59:07Z","title":"When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T01:27:54.164991Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.02821"},"observation_digest":"sha256:f292542612c9aea6be6337af1487065fdc2882b7c02ee36930f7e62af2c36168","observation_id":"0d13f8ec-8dce-48cb-9396-bbf153318aad","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.02821","last_updated":"2026-05-07T06:51:57Z","snapshot_observed_at":"2026-08-02T11:27:54.086295Z","submitted_at":"2026-05-04T16:59:07Z","title":"When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T16:57:26.334739Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.02821"},"observation_digest":"sha256:b2d6c126d70eef4fbd74da299c07f0edfbb7645e64eb95b6eaf74bf2ee1521af","observation_id":"3ff193e2-f2f3-4fc6-b274-bc496e382089","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:855b55e77bd1e75aedcac031f83033978efde217a340a9f166a68efacdfde8b6","observation_id":"b7eba79e-a926-4e8c-bb02-8ab96f49d555","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.05219","last_updated":"2026-04-17T09:24:58Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-17T09:24:58Z","title":"Sparse Prefix Caching for Hybrid and Recurrent LLM Serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T08:49:24.880528Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.05219"},"observation_digest":"sha256:c5b40ff9a70b2bae8c45984889673e37b173d61f6e8af66f6671c009f26c9533","observation_id":"cd91c405-cf97-4b68-9aff-eb202e10c2b4","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.05287","last_updated":"2026-05-06T17:59:21Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T17:59:21Z","title":"Securing the Agent: Vendor-Neutral, Multitenant Enterprise Retrieval and Tool Use","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T16:38:04.876480Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.05287"},"observation_digest":"sha256:680048b0634ba9527bf798caf39e2d05f9f40300c0f693da856bfc799fb83275","observation_id":"b7d4c32f-9706-4f7f-ae37-3ff1f82f4ea3","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.05899","last_updated":"2026-05-07T09:11:41Z","snapshot_observed_at":"2026-08-05T02:12:24.336765Z","submitted_at":"2026-05-07T09:11:41Z","title":"VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-09T16:10:22.588945Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.05899"},"observation_digest":"sha256:08f98f0354799b5d485df232f3e0429fc7bc07896bdb7b988ad35c28949b3a08","observation_id":"ad73c77c-d20c-4fd6-b94a-5547dbb74204","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.06068","last_updated":"2026-05-07T11:54:53Z","snapshot_observed_at":"2026-08-03T02:15:04.517022Z","submitted_at":"2026-05-07T11:54:53Z","title":"VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-08T10:44:55.943351Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.06068"},"observation_digest":"sha256:268c24ae865f530a44db1abd94ac3ff5c5ba87468dc8e11806f6f2ebc1d1d5af","observation_id":"fd1b0b98-b4b8-47e6-9803-ec22097f3e1a","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.06850","last_updated":"2026-05-07T18:51:57Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T18:51:57Z","title":"How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:30.458137Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.06850"},"observation_digest":"sha256:d883be3af5422ee117fc8521bd75c013a58028ae624af270b830c9fa3782159e","observation_id":"b3dc821e-22e1-4b0c-8972-16b2b54f21eb","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.07985","last_updated":"2026-05-21T13:49:15Z","snapshot_observed_at":"2026-08-02T04:20:16.015867Z","submitted_at":"2026-05-08T16:44:47Z","title":"Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T02:42:32.739352Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.07985"},"observation_digest":"sha256:8b614ef381200c7be140e25cb917dab622ccdefd7cec2026fdef4a4190f570b0","observation_id":"e5b66506-6dcb-4c0c-9d23-dbe0aefb4728","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.07985","last_updated":"2026-05-21T13:49:15Z","snapshot_observed_at":"2026-08-02T04:20:16.015867Z","submitted_at":"2026-05-08T16:44:47Z","title":"Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T10:20:45.375375Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.07985"},"observation_digest":"sha256:0c929a7531bdae55fe1797a937ed9720e77f9189a98119c2a72f83d134c56d6c","observation_id":"28060f05-4488-40bc-9fcd-36cec22f71c6","resolution":{"observed_at":"2026-05-22T10:21:23.945417Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.09735","last_updated":"2026-06-30T03:39:11Z","snapshot_observed_at":"2026-07-06T23:21:49.499951Z","submitted_at":"2026-05-10T20:10:26Z","title":"KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T03:57:30.104609Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.09735"},"observation_digest":"sha256:8b6cf58328e811fd4cb5f34817c6aab47bef336839dc5eebc824165a3330a084","observation_id":"c06c480b-8f8d-4fe8-b9b3-33386d6b83fb","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.09735","last_updated":"2026-06-30T03:39:11Z","snapshot_observed_at":"2026-07-06T23:21:49.499951Z","submitted_at":"2026-05-10T20:10:26Z","title":"KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:44.256565Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.09735"},"observation_digest":"sha256:fa653b1f8fec1ecf020046a7dabdf7eb1945cb5b21460631b7102cd3a27fe494","observation_id":"89ebd297-0578-4958-b9c5-6d581bdfcf51","resolution":{"observed_at":"2026-07-01T08:15:32.464109Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.10670","last_updated":"2026-05-11T14:53:00Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T14:53:00Z","title":"Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:58.729425Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.10670"},"observation_digest":"sha256:3112e8d2bfb706c7635e0fbe260e16428d1e74a9fb5535cb9586504f3e86359e","observation_id":"8398f1d4-a84e-4003-aa33-507fe504b73f","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.10832","last_updated":"2026-06-05T07:49:38Z","snapshot_observed_at":"2026-07-31T06:36:29.123202Z","submitted_at":"2026-05-11T16:49:36Z","title":"Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:15:40.042348Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.10832"},"observation_digest":"sha256:a63586648d350df7db718ea0e2eabc4b3029be800ffd1249fbaab47a2177f17f","observation_id":"4c531d5e-010a-446c-9463-834072b0d43d","resolution":{"observed_at":"2026-05-12T08:20:01.305558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.10832","last_updated":"2026-06-05T07:49:38Z","snapshot_observed_at":"2026-07-31T06:36:29.123202Z","submitted_at":"2026-05-11T16:49:36Z","title":"Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T22:30:28.649803Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.10832"},"observation_digest":"sha256:3c1bf8d5f44192349804361f8a74664e1417774a24eed808936ef95419b06279","observation_id":"17fb4adf-ee85-4319-9dae-e3a30ef57a59","resolution":{"observed_at":"2026-07-01T13:55:46.345891Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.11030","last_updated":"2026-06-30T03:38:58Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-10T21:24:53Z","title":"An Executable Benchmarking Suite for Tool-Using Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T01:08:46.020900Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.11030"},"observation_digest":"sha256:a45dd3c467c900e8b27b59e9907de1b2e9a68a2be4aaa20f1a1ff39f872c805c","observation_id":"f5123a9c-2b52-4052-bc31-966a2c8ab010","resolution":{"observed_at":"2026-05-13T01:52:06.208342Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.12396","last_updated":"2026-05-12T16:57:53Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:57:53Z","title":"NCCLZ: Compression-Enabled GPU Collectives with Decoupled Quantization and Entropy Coding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T03:32:28.187814Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.12396"},"observation_digest":"sha256:fa645e6bd581d0851b61ab762df626da3a22d85fce5da5059c80f8c373ff0d12","observation_id":"a1f9dcf4-d8f7-4f17-8687-e1c7bf3ff911","resolution":{"observed_at":"2026-05-13T03:37:11.445363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.13784","last_updated":"2026-05-13T17:06:15Z","snapshot_observed_at":"2026-08-01T16:38:14.287893Z","submitted_at":"2026-05-13T17:06:15Z","title":"Attention Once Is All You Need: Efficient Streaming Inference with Stateful Transformers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-14T19:19:43.718149Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.13784"},"observation_digest":"sha256:dbd08fe85650f7223749c15efee140837b49ad2ce5c185b4e51c7684c8eec082","observation_id":"72295d26-52dc-47e1-9d7f-f27904a2e39e","resolution":{"observed_at":"2026-05-14T19:22:51.296567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.15422","last_updated":"2026-07-17T00:16:42Z","snapshot_observed_at":"2026-08-02T14:03:06.376501Z","submitted_at":"2026-05-14T21:11:32Z","title":"DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-19T15:48:59.800756Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.15422"},"observation_digest":"sha256:310f9cf8c05f90c16167ae0ab99e6e69b4dd91ad0a1fc68587528306afaccda6","observation_id":"3aa5c586-3078-4fef-b59c-fcc6aa720414","resolution":{"observed_at":"2026-05-19T15:52:38.385803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.15422","last_updated":"2026-07-17T00:16:42Z","snapshot_observed_at":"2026-08-02T14:03:06.376501Z","submitted_at":"2026-05-14T21:11:32Z","title":"DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-30T20:58:51.141871Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.15422"},"observation_digest":"sha256:f963db24a349cb1f06193310d9b32a7d90d2ff87c0ff3b3915075b6b6cacf02e","observation_id":"5cfe0c73-b624-47cf-8e24-8021eb71098b","resolution":{"observed_at":"2026-06-30T21:05:04.569758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-02T14:03:10.541975Z","title":"SGLang : Efficient execution of structured language model programs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.15422","last_updated":"2026-07-17T00:16:42Z","snapshot_observed_at":"2026-08-02T14:03:06.376501Z","submitted_at":"2026-05-14T21:11:32Z","title":"DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T14:03:10.541975Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.15422"},"observation_digest":"sha256:da087534927e7c983c345a22c4fa0e8d2056b3e112e7a2c85938fce8e0f47dea","observation_id":"6d3f47e6-ac61-498a-8977-6ada1b1d7dee","resolution":{"observed_at":"2026-08-02T14:03:10.541975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.17172","last_updated":"2026-05-16T22:00:10Z","snapshot_observed_at":"2026-07-06T23:28:12.114488Z","submitted_at":"2026-05-16T22:00:10Z","title":"OpenJarvis: Personal AI, On Personal Devices","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-20T14:26:16.480948Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.17172"},"observation_digest":"sha256:4aec335c2e11b2bcdb4b783fe862b67470bb8f9b8d375f998dfef8fb67f086df","observation_id":"4173c3bc-c9bf-48a7-999a-7f97326069e5","resolution":{"observed_at":"2026-05-20T14:28:21.232464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.21974","last_updated":"2026-05-21T04:08:42Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T04:08:42Z","title":"Format-Constraint Coupling in Knowledge Graph Construction from Statistical Tables","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-22T06:43:31.886617Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.21974"},"observation_digest":"sha256:ede79d368e87b83bf6b22380885dc4bcc6fe19cbb050cb4189eb2ed799459535","observation_id":"21034799-bddb-4951-b43e-ccb6c92e8072","resolution":{"observed_at":"2026-05-22T06:44:41.999964Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.22416","last_updated":"2026-05-21T12:37:34Z","snapshot_observed_at":"2026-07-06T23:32:44.699825Z","submitted_at":"2026-05-21T12:37:34Z","title":"Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T07:28:35.020478Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.22416"},"observation_digest":"sha256:9bd61157a0cacd938a8d088977efe863107389c2c0755bc1f18a7f8cbcda5d43","observation_id":"ff640e11-23b6-41c9-9f00-e404c7919708","resolution":{"observed_at":"2026-05-22T07:31:14.081205Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.24217","last_updated":"2026-05-26T05:47:59Z","snapshot_observed_at":"2026-07-06T23:34:18.555542Z","submitted_at":"2026-05-22T20:57:26Z","title":"Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T15:42:21.405913Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.24217"},"observation_digest":"sha256:d95366cc45d94a424039fa26eb3e4497f12f6c26d279f693e938dd37a7799204","observation_id":"83f8063c-b2d8-4ce0-b475-5edcb3c41c8a","resolution":{"observed_at":"2026-06-30T15:44:48.303225Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.24220","last_updated":"2026-05-22T21:06:12Z","snapshot_observed_at":"2026-07-06T23:34:18.555542Z","submitted_at":"2026-05-22T21:06:12Z","title":"Polar: Agentic RL on Any Harness at Scale","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T14:38:14.073340Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.24220"},"observation_digest":"sha256:917fc9792f943a0e7636166a6b7ed1894a9a74782a8a24f2751f33eb28a046cd","observation_id":"b9652e40-f9f6-4e5d-8a82-71ac2f4f709e","resolution":{"observed_at":"2026-06-30T14:44:45.311780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.26128","last_updated":"2026-05-20T07:11:32Z","snapshot_observed_at":"2026-08-01T15:25:52.680612Z","submitted_at":"2026-05-20T07:11:32Z","title":"The Constraint Tax: Measuring Validity-Correctness Tradeoffs in Structured Outputs for Small Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:39:16.469049Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.26128"},"observation_digest":"sha256:b4b590825d1050db6c25a79f1934312b18852b841fca44ff55240ffc1c7e5dfe","observation_id":"2e38ec5f-ca75-48b3-b722-84089385d332","resolution":{"observed_at":"2026-06-30T17:44:57.797981Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.26289","last_updated":"2026-05-25T19:27:49Z","snapshot_observed_at":"2026-07-06T23:36:11.031436Z","submitted_at":"2026-05-25T19:27:49Z","title":"Stateful Inference for Low-Latency Multi-Agent Tool Calling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T22:39:27.600051Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.26289"},"observation_digest":"sha256:505613c66d69e762c80c011af9c9fe9dc9a046fef903e569950e48d70688ae4e","observation_id":"4e71b475-38ef-4ec8-b547-19e578e0aaa2","resolution":{"observed_at":"2026-06-29T22:44:01.523426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.26861","last_updated":"2026-05-26T11:20:09Z","snapshot_observed_at":"2026-08-02T14:18:12.692996Z","submitted_at":"2026-05-26T11:20:09Z","title":"REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T18:19:10.346738Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.26861"},"observation_digest":"sha256:49532d6fcdc0d41ffabc462e892cdd234b5d7a285669fffa70f8e6ab3c6fcfdd","observation_id":"0c334fdb-00fa-4dd5-a7bf-0386f8199c22","resolution":{"observed_at":"2026-06-29T18:23:50.724064Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.27763","last_updated":"2026-05-26T23:22:55Z","snapshot_observed_at":"2026-07-31T18:23:26.053584Z","submitted_at":"2026-05-26T23:22:55Z","title":"A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T18:03:19.798168Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.27763"},"observation_digest":"sha256:2fa1bf8179448e88035c99b47a978dd76c3913b7b10d1af3efc354c05720cd0d","observation_id":"6fe9a0f9-2032-40cb-b238-589ffeebb5f9","resolution":{"observed_at":"2026-06-29T18:03:47.821304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.28095","last_updated":"2026-05-27T07:52:03Z","snapshot_observed_at":"2026-08-05T11:09:49.545612Z","submitted_at":"2026-05-27T07:52:03Z","title":"SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T10:07:06.141581Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.28095"},"observation_digest":"sha256:e5b8fcaeae31f1ace474c3e493d3f6a164fa07c7f61cf4c852919290a37cc500","observation_id":"fc15d38b-2c6f-41c7-a2c1-676b57deea6f","resolution":{"observed_at":"2026-06-29T10:13:17.821608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2605.29343","last_updated":"2026-05-29T03:17:50Z","snapshot_observed_at":"2026-08-02T13:42:11.873594Z","submitted_at":"2026-05-28T04:30:22Z","title":"Draft-OPD: On-Policy Distillation for Speculative Draft Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T07:33:39.119309Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2605.29343"},"observation_digest":"sha256:35cc5c92e256b4bff4b39bdd6dd9e0e97cb254cb2fe7d382d5e2b052db45ff1b","observation_id":"884b777e-3abd-4dea-b920-bb4dc0c0956d","resolution":{"observed_at":"2026-06-29T07:43:13.246143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.01143","last_updated":"2026-06-03T04:16:23Z","snapshot_observed_at":"2026-07-06T23:41:43.820102Z","submitted_at":"2026-05-31T10:24:10Z","title":"Schedule-Level Shared-Prefix Reuse for LLM RL Training","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T16:43:39.796020Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.01143"},"observation_digest":"sha256:0fa3c63fae939b9dc421f46bc5927966f054f21454f1e7813dcedf4886f1e11b","observation_id":"891319e3-785e-43f7-aed2-e2e2fc9c80cb","resolution":{"observed_at":"2026-07-01T21:36:15.136976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.01927","last_updated":"2026-06-01T08:58:23Z","snapshot_observed_at":"2026-07-06T23:42:26.018647Z","submitted_at":"2026-06-01T08:58:23Z","title":"Scaling LLM Inference Beyond Amdahl`s Limits via Eliminating Non-Scalable Overheads","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T12:48:02.761437Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.01927"},"observation_digest":"sha256:8ab4378546742ff57d05d81ac13e6badcefd6315871277ceb90360e9ed4e57a8","observation_id":"de2fdcd6-e2d9-4f62-b903-82666e52ffb9","resolution":{"observed_at":"2026-07-02T01:06:24.189836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.02982","last_updated":"2026-06-19T15:23:40Z","snapshot_observed_at":"2026-07-06T23:43:17.879245Z","submitted_at":"2026-06-02T00:39:31Z","title":"DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T07:47:26.074448Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.02982"},"observation_digest":"sha256:cfd20344ef159b3e1c78e7ff46a4d890ed4803b77763af02eae06a9077101060","observation_id":"083c2371-c491-4faa-91e4-952d5f754bab","resolution":{"observed_at":"2026-07-02T06:06:40.720499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.04847","last_updated":"2026-06-03T13:15:30Z","snapshot_observed_at":"2026-08-01T18:57:38.124358Z","submitted_at":"2026-06-03T13:15:30Z","title":"MusaCoder: Native GPU Kernel Generation with Full-Stack Training on Moore Threads GPU","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T06:58:31.351774Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.04847"},"observation_digest":"sha256:5f316db8d96c5c169b3c8040363351dc6123a63737dc3d3676ff4af1706fbfeb","observation_id":"8c80b046-d9a5-4f30-87cd-91ba8bd118ef","resolution":{"observed_at":"2026-07-02T07:26:45.835943Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:367956e72dc1563e1fab2dd7148b993d09ef1bbcd200fdb7b358dd916b476449","observation_id":"56210994-c691-4877-bf4b-b9f6d58aa3b6","resolution":{"observed_at":"2026-06-28T01:51:29.010070Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.06302","last_updated":"2026-06-04T15:41:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T15:41:27Z","title":"Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T02:25:46.234576Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.06302"},"observation_digest":"sha256:4c0192b30800c50d9717de0d57df71f2e5e9c2a276c02068bdecd851e5eb7292","observation_id":"f18438d6-ef0c-4909-8003-5f0d4364358d","resolution":{"observed_at":"2026-07-02T12:06:56.102545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.06453","last_updated":"2026-06-04T17:48:17Z","snapshot_observed_at":"2026-07-06T23:46:15.936608Z","submitted_at":"2026-06-04T17:48:17Z","title":"Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T01:07:14.691347Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.06453"},"observation_digest":"sha256:0575d5f26e46d63979090d58fbe8c03ce904d43a16bbd139e1cbf1434c0a6fec","observation_id":"3fa253e3-bc3e-4ad9-8031-d10c99e06bd7","resolution":{"observed_at":"2026-07-02T13:36:59.419341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.08446","last_updated":"2026-06-07T04:24:45Z","snapshot_observed_at":"2026-08-05T08:26:57.919131Z","submitted_at":"2026-06-07T04:24:45Z","title":"Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T19:10:53.882876Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.08446"},"observation_digest":"sha256:71f780c4e750df635fa06e9105c38d8717e655f03d7760ce43eecf184b855294","observation_id":"ffeb3a49-abcc-4cef-bd56-69957ec9a217","resolution":{"observed_at":"2026-07-02T22:07:26.529373Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.08615","last_updated":"2026-06-07T13:00:19Z","snapshot_observed_at":"2026-08-05T22:03:12.300616Z","submitted_at":"2026-06-07T13:00:19Z","title":"Harnessing Streaming Video in the Wild","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T18:47:55.910417Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.08615"},"observation_digest":"sha256:dbfe57ce9bab25941e860806a7f219c47fb82683c113bb0328619e8e6d18eb02","observation_id":"d0146a87-7f23-42cd-a6fb-01535021a337","resolution":{"observed_at":"2026-07-02T22:37:25.724728Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.09080","last_updated":"2026-06-08T06:26:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:26:18Z","title":"Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T17:02:30.894934Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.09080"},"observation_digest":"sha256:61b2539c239c76bfcc259a05e724b61f0ba83491fb9c887d4915a23a98d5ce0a","observation_id":"6918d03b-d60f-4c51-9979-55617cbe470e","resolution":{"observed_at":"2026-06-27T17:11:05.710367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.09937","last_updated":"2026-06-07T21:36:20Z","snapshot_observed_at":"2026-08-04T21:47:44.012150Z","submitted_at":"2026-06-07T21:36:20Z","title":"RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T18:29:16.153111Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.09937"},"observation_digest":"sha256:a5eb34c070a83f9fb0f8780995a54e1d2434452f0731f715e68f218825428698","observation_id":"159460cc-065c-4e64-935f-8cf432cba2df","resolution":{"observed_at":"2026-07-02T23:07:26.749247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.20474","last_updated":"2026-06-19T08:02:54Z","snapshot_observed_at":"2026-08-06T02:16:22.382356Z","submitted_at":"2026-06-18T16:54:07Z","title":"UltraQuant: 4-bit KV Caching for Context-Heavy Agents","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T17:49:02.835708Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.20474"},"observation_digest":"sha256:97ede2eb21d2f28c45b8459acf8ace9b92121eda7993b402ce0c2e096ff06279","observation_id":"d76ef9d0-6300-4f96-a88f-2753b53f9754","resolution":{"observed_at":"2026-07-04T03:39:30.380619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.20537","last_updated":"2026-06-18T17:49:36Z","snapshot_observed_at":"2026-07-06T23:55:38.979306Z","submitted_at":"2026-06-18T17:49:36Z","title":"Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T17:39:47.477338Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.20537"},"observation_digest":"sha256:b400bc5005046ba1401b4cccfca78a073e92ac66da361d216443696707ab3069","observation_id":"25fb1a25-d229-4ec0-a606-2fd3588df483","resolution":{"observed_at":"2026-07-04T03:49:29.926167Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.20577","last_updated":"2026-05-03T05:31:35Z","snapshot_observed_at":"2026-08-02T10:50:07.904309Z","submitted_at":"2026-05-03T05:31:35Z","title":"Human-Less LLM Serving: Quantifying the Human Tax on Throughput","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T00:44:55.517266Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.20577"},"observation_digest":"sha256:7c45f0379bdd10d5a7cfff3b5bf9db1f47f8758ee0efe4ebfae18493a7337365","observation_id":"9bfadf86-ecfc-4ac3-86b1-237a449e3be3","resolution":{"observed_at":"2026-07-01T00:45:11.809066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.21121","last_updated":"2026-06-19T05:47:44Z","snapshot_observed_at":"2026-08-04T13:33:33.678027Z","submitted_at":"2026-06-19T05:47:44Z","title":"Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-26T14:13:13.678245Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.21121"},"observation_digest":"sha256:a73dc544aafafcfe2a894214e0ac2a9b3c02ffc772a0a0fb453be4306e6faaee","observation_id":"1d5c4e72-1c64-4877-91ba-d608f4bf6484","resolution":{"observed_at":"2026-07-04T06:49:37.573661Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.23969","last_updated":"2026-07-09T21:35:14Z","snapshot_observed_at":"2026-07-15T23:17:48.742749Z","submitted_at":"2026-06-22T21:48:53Z","title":"The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T06:39:04.161585Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.23969"},"observation_digest":"sha256:5789bf3d5497c9551e719d71aa74b1f3dbfd34c373ebee3f58cc6bca7b45b9ec","observation_id":"364ee36a-212e-4a44-a757-f59d9f9cfa5e","resolution":{"observed_at":"2026-06-26T22:10:09.425558Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.27866","last_updated":"2026-06-26T09:08:03Z","snapshot_observed_at":"2026-07-07T00:02:04.432452Z","submitted_at":"2026-06-26T09:08:03Z","title":"FlexMoE: One-for-All Nested Intra-Expert Pruning for MoE Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T04:37:08.966401Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.27866"},"observation_digest":"sha256:7cbb82883c99fc789223b845a089bc26a86cdea7b4e41ced7edf669e8622daac","observation_id":"fd90b1b6-c4c0-4a32-a506-6bfaa07c1a4f","resolution":{"observed_at":"2026-06-29T20:03:56.533297Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.28565","last_updated":"2026-07-02T09:24:03Z","snapshot_observed_at":"2026-08-03T10:20:30.500902Z","submitted_at":"2026-06-26T19:43:38Z","title":"KernelSight-LM: A Kernel-Level LLM Inference Simulator","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T00:48:19.207465Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.28565"},"observation_digest":"sha256:2ae0765e54cb94482b142b534ea649549636d7c3eb336b086b5f5240e4dae321","observation_id":"2bce52ad-96ec-44e1-ba55-529da006ac69","resolution":{"observed_at":"2026-06-30T00:54:06.239888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.28565","last_updated":"2026-07-02T09:24:03Z","snapshot_observed_at":"2026-08-03T10:20:30.500902Z","submitted_at":"2026-06-26T19:43:38Z","title":"KernelSight-LM: A Kernel-Level LLM Inference Simulator","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-03T23:09:38.092583Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.28565"},"observation_digest":"sha256:2b303804ea75c6f09537ed38328240f15382a94a6c027029574b1f63e96a7a50","observation_id":"22ab3e59-a354-4cd7-a124-3bf2c9707e67","resolution":{"observed_at":"2026-07-03T23:19:02.250445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.29563","last_updated":"2026-06-28T19:04:47Z","snapshot_observed_at":"2026-08-02T13:11:07.991129Z","submitted_at":"2026-06-28T19:04:47Z","title":"Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-30T07:19:48.530272Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.29563"},"observation_digest":"sha256:27dcc978376bff8d2a04edd96b000eada4b76fc33531f415bb6e470c39a61cf7","observation_id":"60d3431c-d0c7-40eb-86ea-3db7f5baae15","resolution":{"observed_at":"2026-06-30T07:24:21.333448Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.29565","last_updated":"2026-06-28T19:10:02Z","snapshot_observed_at":"2026-08-03T04:36:58.247393Z","submitted_at":"2026-06-28T19:10:02Z","title":"Speculative Pre-Positioning: Decoding Stateful Sessions to the Next Decision Point Off the Critical Path","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-30T07:32:54.738720Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.29565"},"observation_digest":"sha256:e13b2ec57b59f657b5802dfebb7a390a5618ab269f4330c6d07cbcff4417be68","observation_id":"c30ca5d4-15f2-4a6f-815b-b3bd07ab9313","resolution":{"observed_at":"2026-06-30T07:34:21.336468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.31093","last_updated":"2026-06-30T03:29:21Z","snapshot_observed_at":"2026-08-01T17:26:20.214245Z","submitted_at":"2026-06-30T03:29:21Z","title":"Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T04:13:53.722933Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.31093"},"observation_digest":"sha256:ae72d4265aad8124b6f06cd9f0d3931441851b054386c4550a8fea52e2ec38b7","observation_id":"3b1f8f9e-290f-43b5-8d04-e15c9c36155f","resolution":{"observed_at":"2026-07-01T11:35:43.616162Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2607.00466","last_updated":"2026-07-02T08:02:42Z","snapshot_observed_at":"2026-08-02T22:04:11.416989Z","submitted_at":"2026-07-01T05:34:38Z","title":"ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-02T06:40:53.505889Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.00466"},"observation_digest":"sha256:db60c46776dc65f9d5de41942351a8b833ac30e90b632e36ef425dc258b1f5fc","observation_id":"6298436d-31b8-4141-a5da-aa19cdb95452","resolution":{"observed_at":"2026-07-02T06:56:43.949731Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2607.00466","last_updated":"2026-07-02T08:02:42Z","snapshot_observed_at":"2026-08-02T22:04:11.416989Z","submitted_at":"2026-07-01T05:34:38Z","title":"ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-03T18:58:44.830766Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.00466"},"observation_digest":"sha256:b4b150b4b8aa95a7c650decca91da1de4b48e42fae6e6051dbb823ab29e3d480","observation_id":"1a3fabcc-50c9-4279-930f-575aa58c5c33","resolution":{"observed_at":"2026-07-03T18:58:50.498142Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2607.01579","last_updated":"2026-07-02T01:23:02Z","snapshot_observed_at":"2026-08-02T15:54:32.616830Z","submitted_at":"2026-07-02T01:23:02Z","title":"OmniPilot: An Uncertainty-Aware LLM Inference Advisor for Heterogeneous GPU Clusters","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T06:30:30.308713Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.01579"},"observation_digest":"sha256:64b39371029f6d0bf8e63190a7f4731b7ce3dce121f65cd19f8a4920e62682a7","observation_id":"2e9fe7b7-2041-460d-8eb5-2de22be94f75","resolution":{"observed_at":"2026-07-03T06:37:42.205666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-07-12T11:05:56.233115Z","title":"arXiv preprint arXiv:2312.07104 , x-verified =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02558","last_updated":"2026-06-28T02:30:44Z","snapshot_observed_at":"2026-08-01T21:25:05.137068Z","submitted_at":"2026-06-28T02:30:44Z","title":"MLSYSIM: First-Principles Infrastructure Modeling for Machine Learning Systems","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-12T11:05:56.233115Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.02558"},"observation_digest":"sha256:ecadf903920d3993a2d0aa889f0ee5e238f57f6318a691a6831581bc6e0e8ffe","observation_id":"2f56283a-de44-4c79-811a-022269d6b8dc","resolution":{"observed_at":"2026-07-12T11:05:56.233115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-07-12T05:56:18.797766Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02942","last_updated":"2026-07-03T04:28:49Z","snapshot_observed_at":"2026-08-02T20:27:55.760321Z","submitted_at":"2026-07-03T04:28:49Z","title":"A Workflow-Aware Serving Layer for Agentic Applications","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T05:56:18.797766Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.02942"},"observation_digest":"sha256:dd380749098ab8f0f571a12ae7c7cb0bb21b037a13823982f04257f237b0a65f","observation_id":"1cf6d3df-2fdb-4167-8fb6-c62bf9d2021e","resolution":{"observed_at":"2026-07-12T05:56:18.797766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.07104/citation-record","integrity":"/paper/2312.07104/integrity","json":"/paper/2312.07104/citation-record.json","paper":"/paper/2312.07104"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01869","last_updated":"2024-05-30T04:18:03Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T19:47:57Z","title":"InferCept: Efficient Intercept Support for Augmented Large Language Model Inference","version":2},"cited_work":{"arxiv_id":"2402.01869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01869","snapshot_observed_at":"2026-07-02T17:27:14.649493Z","title":"Apiserve: Efficient api support for large-language model inferencing","venue":null,"work_id":"afe4eff0-7d45-4632-a2e0-fb6b72ca886d","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2402.01869","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:ef2b7bc7b7a2d36477f2bb7d9b1a7c294ef3c7d4541c0f2ebf7ed62ab509d537","observation_id":"6a74ddd4-1c8b-4d04-85ea-4a396ab5641c","resolution":{"observed_at":"2026-05-12T08:20:01.189749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"40995f15-58e1-4bdb-8885-4ad729de9a28","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:55c900158d9eddd55ab4e490e6e4d1fd41b67b20956a012ed495ccba0f77919c","observation_id":"b347b4f8-7709-4be5-9d16-9102b1c22db3","resolution":{"observed_at":"2026-05-12T08:20:01.229584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed- inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"ed7907f7-f39c-4996-808b-99f6a049676a","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:5267d956dc11f0b39beeb1241109ef2cb2ff8a5ecc7c587aea82a32fcc4e67f2","observation_id":"cfa5f099-8e66-4b48-8788-f110d5523b09","resolution":{"observed_at":"2026-05-12T08:20:01.232947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompting is programming: A query language for large language models","venue":null,"work_id":"59479826-b398-45d9-93b2-2172f8fbc674","year":1946},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:e72ef6bab7ad1e7b2a65cf93d6c1170c4b233e296199707110e918aab5ce1adb","observation_id":"222e3b06-ed59-4657-9946-75ac28b2a895","resolution":{"observed_at":"2026-05-12T08:20:01.235949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:21.117928Z","title":"Language models are few-shot learners","venue":null,"work_id":"04bc68bc-b7df-4ec1-8599-da037bd4f085","year":1901},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:2347f1690cbdf8701162ca9b47591c65bcdd00384dc4512c0f13310373820fad","observation_id":"d6225a0e-e2ac-4848-b0ac-42a84a4bb767","resolution":{"observed_at":"2026-05-12T08:20:01.239435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":"2303.12712","doi":"10.48550/arxiv.2303.12712","metadata_source":"pith","pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","venue":"cs.CL","work_id":"a23cfe92-7f7c-424b-98d4-b386a83002fb","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:2193f29adcd18251291038e2fb1f4385a666fbe9d186973f017cf72276fbbc03","observation_id":"a2bf951c-e3c7-438e-a045-66f735e760f9","resolution":{"observed_at":"2026-05-12T08:20:01.095155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"4929892c-c44d-4ef0-8378-c75088534dd0","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:9eed5d6c941d42dea40300aa8c85ef4f946fc9cd18415a7984151ea924fdfda7","observation_id":"5c510580-7f54-49ab-8e5e-829538ee0a74","resolution":{"observed_at":"2026-05-12T08:20:01.242215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":"2403.04132","doi":"10.1007/s11336-009-9136-x","metadata_source":"pith","pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","venue":"cs.AI","work_id":"a1eb83da-5727-4b63-977f-81c6fdd33936","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:d0cd1b281c18de3b6c767b4dc9a70a837ff26fa7839eb90c5ef93fb973b2de23","observation_id":"f6666ca9-1e4f-4bdb-b702-6f659369aceb","resolution":{"observed_at":"2026-05-13T15:13:25.541930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:ae6b8d198105722d03578519abf7b6e37c36fcf45fa60985395a7c934983645f","observation_id":"5b114185-21e5-47b0-af92-dfe57e4809d8","resolution":{"observed_at":"2026-05-12T08:20:01.071915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in Neural Information Processing Systems, 35:16344–16359","venue":null,"work_id":"3e33869a-9182-4187-90f6-0a1149bdbb50","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:498e147b2c5ae56bd6a55d9f56af2d4b8ccfdbd88887f8d3ceff5e53a6c73cd0","observation_id":"9a9d5276-b026-4565-9745-586e13278345","resolution":{"observed_at":"2026-05-12T08:20:01.245282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":"e750d6fe-3407-422f-b717-6894d689a330","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:661a5371c079e0592ab944a38f9c0be4d9e8fe612ee5d2db47e5655f3c4d8b8e","observation_id":"8161cbd0-a3ce-4ff1-bcb4-8f19c6ee6dc4","resolution":{"observed_at":"2026-05-12T08:20:01.248190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-07-06T16:44:55.494764Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:d0adeb3977176f4ffa74e06509da0692477f71a06070851a6febd04c91bcbc17","observation_id":"dd159a32-1bc2-4141-8132-23950eee6907","resolution":{"observed_at":"2026-05-12T08:20:01.060678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A guidance language for controlling large language models","venue":null,"work_id":"77f9218a-0b16-47c7-93c4-e6dbba49367a","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:fcc10245c8c0c1469d14f1896962203c2c9abec678a5539283e2c00b59416c9d","observation_id":"a3156d99-88b5-4a7f-8d5e-220dd2014b0f","resolution":{"observed_at":"2026-05-12T08:20:01.251034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"255dbfa7-b995-4057-ace7-b82a01800e0a","year":2020},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:32dcc9020e8be152c216f175514b454c5914c0feb95d2794e10da630ca8d342e","observation_id":"02314b4d-771e-4e98-95cd-fd7a80d63454","resolution":{"observed_at":"2026-05-12T08:20:01.253854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:7da8d5226031092b50a851bcf7c4d4d86ef70b3f3843be4489322bbb3e477cd5","observation_id":"f0ce2c05-fd48-4cd7-8700-7480987707f1","resolution":{"observed_at":"2026-05-12T08:20:01.106533Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text generation inference","venue":null,"work_id":"3d1f7c23-2153-4a81-80e8-38c0d78e4ea7","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:0201b6b1139f3f628a5cc35964f9c6a3cada9580b6d44cee64cd97951e5fa1c5","observation_id":"22dbdc37-18d0-4486-a3d7-f15d598bbfd0","resolution":{"observed_at":"2026-05-12T08:20:01.256958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:151d8dfbdc246cbbb97aa9b60ba38c3b4c8eea9207ac5293ba064639a88b1fda","observation_id":"e88c493e-4ea4-44f2-a79e-04395ba29cc6","resolution":{"observed_at":"2026-05-12T08:20:01.149376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-04T23:21:31.317269Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":"2402.05099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-07-04T11:39:46.505898Z","title":"Fu, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":"252d1f81-2da6-4fc8-bb70-6859e2743517","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:3cc2d28dc4061560cf1cd77a19d97342b698e7fd99df91bf0928feff9eedc5c3","observation_id":"8dc0df40-83bd-4002-b1a2-e7021f3f8de3","resolution":{"observed_at":"2026-05-12T08:20:01.176768Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:b00f724de8da6a7c8e7e4c9adc1229a8810935cc69a99752d7bda9aec7971063","observation_id":"4c274a29-48b0-4191-a303-036c206199ef","resolution":{"observed_at":"2026-05-12T08:20:01.181115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":"2310.03714","doi":"10.48550/arxiv.2310.03714","metadata_source":"pith","pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","venue":"cs.CL","work_id":"d490f594-f5fc-47b0-ae6a-6550e50fe095","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:584588d851a64c14652e26dcf70e52f9a852c8a38f9ae86b8d06fe06ec057774","observation_id":"102c2646-90ea-498c-95fb-b32e4e104da7","resolution":{"observed_at":"2026-05-12T08:20:01.184879Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04511","last_updated":"2024-06-05T03:53:10Z","snapshot_observed_at":"2026-07-06T16:58:27.612525Z","submitted_at":"2023-12-07T18:32:04Z","title":"An LLM Compiler for Parallel Function Calling","version":3},"cited_work":{"arxiv_id":"2312.04511","doi":"10.48550/arxiv.2312.04511","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04511","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Y ., Gu, Q., Wen, Z., Li, Z., Xing, T., Guo, S., Zheng, T., Zhou, X., Qu, X., Zhou, W., Zhang, Z., Shen, W., Liu, Q., Lin, C., Yang, J., Zhang, G., and Huang, W","venue":"arXiv (Cornell University)","work_id":"bfc27104-608f-440f-9818-971dfd187ca9","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2312.04511","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:a2151b30fad7fe8fe7df998c1bab0f1a17582315502e65442656f04a5985ef14","observation_id":"aa6b9cdd-d472-4b54-830b-b2b035656591","resolution":{"observed_at":"2026-05-12T08:20:01.051787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Validating large language models with relm","venue":null,"work_id":"ce3763fb-9356-49a7-83dc-4d38afb48fc0","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:dd54c477dbb448c99611e0f689cfb2736b03c0fb3b4d8db28041572e3b771388","observation_id":"467bc4d9-5eeb-4dd8-ab7d-7288bc48faba","resolution":{"observed_at":"2026-05-12T08:20:01.259766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"82959691-fce8-4c65-a800-31ba2bad7411","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:318138dca909a4922c0fd7be8020713d3f1bd80d9ae3f4d1b3d4b97201d0e0a3","observation_id":"cd4e539b-a689-46ef-8cbb-807e5a8d3822","resolution":{"observed_at":"2026-05-12T08:20:01.262617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Langchain","venue":null,"work_id":"7cdf848a-e628-467d-8736-1ae313a29dda","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:28d6e5b0b11d46a5a82048381cd5ce69502b4f07fb80c5fd0752a935c2e768a2","observation_id":"b6ae0b63-a0e2-4f5e-b038-e68abab52220","resolution":{"observed_at":"2026-05-12T08:20:01.265246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":"796f6a59-4bb2-4fee-a94f-83dd809d2561","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:dff7a2ef1b140fedcfee2aa95429ada7a854b6c196a4fb3c12e965e0d4750e50","observation_id":"93dea5ef-e549-421f-812b-9e58b5adca8d","resolution":{"observed_at":"2026-05-12T08:20:01.267951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":"2306.00978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-07-10T11:17:03.640788Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","venue":"cs.CL","work_id":"ea9d1d72-db24-4cae-8c89-4ecd83dd87c1","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:21ce6ae15b3d89359ea2b8d36ded5a576002be6c0f07af4d777c0e2e2c9d6c5e","observation_id":"11f75dab-de9a-4207-a686-38d025a71289","resolution":{"observed_at":"2026-05-12T08:20:01.111415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:6603d19331d6c3ad67166a4e00a2365a07772aa71c2bbf9c084509f50ad13d5e","observation_id":"6bef4281-47d3-4d0b-a34a-3135424c8f37","resolution":{"observed_at":"2026-05-12T19:11:34.143871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.744861Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"a84f281e-7f3f-4b95-9aaf-e3ba559cbf78","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:349e835f5f1d3c9cdd1cba642fbe72c32413e30f901100039680e708462d5fd9","observation_id":"97d09804-584a-42d1-94db-9eaecdbba861","resolution":{"observed_at":"2026-05-12T08:20:01.270855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05821","last_updated":"2025-04-09T10:23:39Z","snapshot_observed_at":"2026-08-03T17:29:07.586078Z","submitted_at":"2024-03-09T07:01:44Z","title":"Optimizing LLM Queries in Relational Data Analytics Workloads","version":2},"cited_work":{"arxiv_id":"2403.05821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.05821","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing llm queries in relational workloads","venue":null,"work_id":"2c903435-1559-4dc5-a09f-03354f326e0a","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2403.05821","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:6da4f3a482ef78306a1150b0c7166927f5be0c7b7606163fdf773e2bc02777fe","observation_id":"e2fe388f-f18b-4bd7-9039-26cb1fcc4d43","resolution":{"observed_at":"2026-05-12T08:20:01.136725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12785","last_updated":"2023-11-21T18:51:03Z","snapshot_observed_at":"2026-07-06T16:50:42.754354Z","submitted_at":"2023-11-21T18:51:03Z","title":"Prompting Frameworks for Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2311.12785","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.12785","snapshot_observed_at":"2026-07-01T23:26:22.006387Z","title":"Prompting Frameworks for Large Language Models: A Survey","venue":null,"work_id":"28879768-ad9f-4598-98f5-6701657227e3","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2311.12785","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:bea782d4e0ac7aa6a452dec150e356ce83a03412d728f5bb9eaf9e9b85292626","observation_id":"119edb1b-f6fc-4628-8d29-d3ec447e9e46","resolution":{"observed_at":"2026-05-12T08:20:01.146006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scissorhands: Exploiting the persistence of impor- tance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"9aeec069-dad8-4d69-8beb-3c1582fa8f89","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:94c469920224e12e945f6bf7a41fb08428d4cad92ede3b444723326dec9cd772","observation_id":"a53583b1-1e75-4360-80df-7418980dded1","resolution":{"observed_at":"2026-05-12T08:20:01.274141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":"2402.02750","doi":"10.48550/arxiv.2402.02750","metadata_source":"pith","pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":"cs.CL","work_id":"735737c3-24e5-41c3-ab4f-04edcb36731c","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:bb65e1c3c828bfa6cc21daf790bfbfb8daaa914f2c89e9b8c94ac232b77df60b","observation_id":"0735568f-dbb2-4efc-ad5b-90524c111cb0","resolution":{"observed_at":"2026-05-12T08:53:12.376678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skeleton- of-thought: Prompting LLMs for efficient parallel generation","venue":null,"work_id":"42ded7a3-0504-4fac-8348-800e3bc27f3e","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:1b5273b4bf390c7ea7372480d895351d699bb6668c49a71de5ed99babf73d831","observation_id":"9ed3cef9-2a5a-4609-8810-538bcadcb404","resolution":{"observed_at":"2026-05-12T08:20:01.277308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tensorrt-llm","venue":null,"work_id":"067854a8-bb01-43fa-b889-38d7e5c12c6a","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:9f12770e89e789c4c1f9bb04f6da2c959f8ca32efc07675b9a254fa9d674dc14","observation_id":"b9e6dfef-c1e3-4282-833e-29fc99778ec7","resolution":{"observed_at":"2026-05-12T08:20:01.280050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:26:54.787661Z","title":"Gpt-4 technical report","venue":null,"work_id":"388f534c-855a-4366-b933-f07bf3e2db5f","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:fc5cde900fb5295ba25e1a202cec777a3e44841e8de3db63d2b3e81c372f93f9","observation_id":"fe9e2e16-12c9-4755-886d-040f99da480a","resolution":{"observed_at":"2026-05-12T08:20:01.282769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"O’Brien, Carrie J","venue":null,"work_id":"01cef04e-e41f-464e-b7ef-25f08928a171","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:21d197a349bd03e76d4770d3d5d9a8f3d29c47c1ccb643abfeaf349e89171d28","observation_id":"b5ed99bc-5455-44d8-95c2-bc8ba52ea017","resolution":{"observed_at":"2026-05-12T08:20:01.285365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"6addb0b0-6828-4fcd-ab53-dcc750a8a8cb","year":2019},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:91aef1fa655b0a686ba7fec7e3a1ebdcb632e966533125860de434a67836c730","observation_id":"d7b9b901-6dde-44a2-b694-c3e5adef8cf2","resolution":{"observed_at":"2026-05-12T08:20:01.288995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":"2305.15334","doi":"10.48550/arxiv.2305.15334","metadata_source":"pith","pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gorilla: Large Language Model Connected with Massive APIs","venue":"cs.CL","work_id":"126a464a-4a73-495f-b669-de1e44aa8f09","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:f2af4d9777b3d8ca7dee100b512b148bd7a1e29a025157a22e8d6497b3da8225","observation_id":"e4c379df-e753-4d3e-a163-ec6de16abe71","resolution":{"observed_at":"2026-05-12T08:20:01.065788Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"3e3d2775-70e1-4be0-b23c-94f4e558c383","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:17eed8a07f26323fb2dfc671022ca9896aa33c0501a4097222fd76d1efd67f0c","observation_id":"3f5f4433-affe-49a3-a4e5-34b4640bff3c","resolution":{"observed_at":"2026-05-12T08:20:01.291869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15123","last_updated":"2024-06-07T16:08:49Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:29:48Z","title":"Branch-Solve-Merge Improves Large Language Model Evaluation and Generation","version":2},"cited_work":{"arxiv_id":"2310.15123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.15123","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Branch-solve-merge improves large language model evaluation and generation","venue":null,"work_id":"3d0f6840-34e6-47b0-a438-fcd883d483bc","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2310.15123","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:da6033f684de9863ea98a5f826fd829cfbc04bb353f52ef4de62bf9a7d613a04","observation_id":"ee83fe8c-3d29-44d9-8141-754db48372c6","resolution":{"observed_at":"2026-05-12T08:20:01.078104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":"2302.04761","doi":"10.48550/arxiv.2302.04761","metadata_source":"pith","pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","venue":"cs.CL","work_id":"9bce40c8-cfd7-4983-80e0-c3bd4402322a","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:494145b5a82fea8bf7b516f6965d08e7fe2c9e55cc9ee02065b83a0c69e1c83f","observation_id":"29cfe3c7-7df4-46dc-aa8e-6f7cbf7fd161","resolution":{"observed_at":"2026-05-12T08:20:01.083748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:11.107254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:11.107254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00588","last_updated":"2024-06-05T06:43:16Z","snapshot_observed_at":"2026-08-02T21:41:47.860513Z","submitted_at":"2023-12-31T21:15:54Z","title":"Fairness in Serving Large Language Models","version":2},"cited_work":{"arxiv_id":"2401.00588","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.00588","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fairness in serving large language models","venue":null,"work_id":"42305fb9-e647-4aab-b47e-de0c9558dfc2","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2401.00588","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:1807b5be1c5644b6cff9b2b9231a90839ece4029b1d2e79787cc8dfca9e34e36","observation_id":"d50df4e9-57fb-45d3-a95e-ca3f44752149","resolution":{"observed_at":"2026-05-12T08:20:01.089977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexgen: high-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"6e12845a-f354-46bd-8e3c-1676620ee0a1","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:87422f79bc8944cbf2327804775f2b4d95706a7e139934220a2c085ec2ec3703","observation_id":"db7e1274-624e-4de8-a56f-f16fe85fe872","resolution":{"observed_at":"2026-05-12T08:20:01.294768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:5ba571dedc1417bc1fa52e5d341ad839df4f198fb1f2d009662fea1d6da4848c","observation_id":"b9d0f233-c377-4ed9-8dfa-7df0dfe79328","resolution":{"observed_at":"2026-05-12T08:20:01.100447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preble: Efficient distributed prompt scheduling for llm serving","venue":null,"work_id":"e66c36b8-4541-4cfe-912e-f53fae557136","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:7a4c12e71e3a2e416931b465cec64a41c83f4ea19540570db93e0639307c349f","observation_id":"40c2f736-b5ee-4e78-8293-49a484249d2e","resolution":{"observed_at":"2026-05-12T08:20:01.297834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive architec- tures for language agents","venue":null,"work_id":"5f27ee48-5c01-494a-8bb1-6ab5573620df","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:6a06a4d09622890c19420cdd592a2c1b66127c181f30e88a9862d9d700151f15","observation_id":"5bddc7cd-152d-4182-a952-ad1bd8e58035","resolution":{"observed_at":"2026-05-12T08:20:01.300984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:95fd4c687bb2958d898b4a94705571a1ec8b6a43c8c73dca97af58c04547e7c7","observation_id":"3fd41751-957f-4c58-8d78-565e7ead93f6","resolution":{"observed_at":"2026-05-12T08:20:01.116096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Triton: an intermediate language and compiler for tiled neural network computations","venue":null,"work_id":"4c0c5b4b-fd9f-4113-9c1c-01cd1c0851a0","year":2019},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:047d6acdd27174cb57dd364bf5527c7d5f501fc23cbb332ce0572c10a66219de","observation_id":"dc261552-7ec8-47db-b99d-d54239b727d0","resolution":{"observed_at":"2026-05-12T08:20:01.304576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:058ca6be74e16d7a93e835563a1e26abf49c31a88277e9ac0933b0061909aad2","observation_id":"81c43e3d-5c12-4c9d-bcb2-9a7a86abf7da","resolution":{"observed_at":"2026-05-12T08:20:01.126803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast, high-fidelity llm decoding with regex constraints","venue":null,"work_id":"7155e017-7c33-42c7-95f9-dd2da2334807","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:6a05f6c2f502e03a7a38fe38d1ea634b5da4a16bdde9ebf30abeeced042ff044","observation_id":"635e28f4-f792-4512-9142-8d833297cc99","resolution":{"observed_at":"2026-05-12T08:20:01.194759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"ac9d72e5-eb60-417e-963d-25671207074e","year":2017},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:5367fcffd03c5381033d3f7a4fd15a89e2b23f2bf44a45dade1056712880c21a","observation_id":"3a590169-463e-4d0d-b548-b48f07c1d48c","resolution":{"observed_at":"2026-05-12T08:20:01.200070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.16291","doi":"10.18653/v1/2023.emnlp-main.118","metadata_source":"pith","pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","venue":"cs.AI","work_id":"ffe0d207-86cf-4742-a100-e988ac8b9676","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:259bd55cbfabc628e7e63121c6039d14646cd5ab44eac3c4aa65802210f6c4a6","observation_id":"fa982f5a-1680-4661-b7d7-86df00d044bd","resolution":{"observed_at":"2026-05-12T08:20:01.141382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":"55eaa9bc-51b1-4aaa-8ee7-066ddb14d037","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:6906fa4f0f2233c3f8725b499f52b88edb84f518b8769b22d4a1dfa3ba342f3a","observation_id":"d131e241-e0a1-45ad-bd2e-3af1639e5821","resolution":{"observed_at":"2026-05-12T08:20:01.204425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient guided generation for large language models","venue":null,"work_id":"4feba097-62cf-4cd9-a8d3-559715993496","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:4c39107f3003fcabc6117603d829f4ecbd9f87fdac751ad8a8bfd927bf7e960a","observation_id":"edf0df46-2270-4f2e-aaf1-a2aaa2880b3b","resolution":{"observed_at":"2026-05-12T08:20:01.207700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-07-31T19:03:03.494918Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":"2308.08155","doi":"10.48550/arxiv.2308.08155","metadata_source":"pith","pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","venue":"cs.AI","work_id":"92b7eb9c-c3d8-4518-a376-06fa15dd895b","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:acc997cbcf66bcde52e174d0d2bef87394569eafc7641d5317fa587b3d6c68bd","observation_id":"b6b32f6d-5a96-421c-ba41-0df032b1ed7f","resolution":{"observed_at":"2026-05-12T08:20:01.158301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:20.607676+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:20.607676+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.10601","doi":"10.48550/arxiv.2305.10601","metadata_source":"pith","pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","venue":"cs.CL","work_id":"07adb06e-4ed5-4ec5-a7ae-ff288fd214fb","year":2023},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:c4fe7c3ed430c879d9b14c95e883d072a0f310a3064e57113c3fb03f47d89c00","observation_id":"8bc1570a-30a3-4a00-91ed-eea3e61fb91e","resolution":{"observed_at":"2026-05-12T08:20:01.162196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"a07f7e2b-2c86-4407-90c1-a2ef4e3b163f","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:c085bf629218d02ba19acd55f3ebb3af1d59cca8b989688270aa5129756881d5","observation_id":"1144386f-bf4b-473f-b9dc-d2c6938a4606","resolution":{"observed_at":"2026-05-12T08:20:01.211481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15220","last_updated":"2024-08-01T07:51:25Z","snapshot_observed_at":"2026-08-04T06:24:10.295170Z","submitted_at":"2024-02-23T09:29:19Z","title":"ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition","version":4},"cited_work":{"arxiv_id":"2402.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15220","snapshot_observed_at":"2026-07-01T08:15:32.438184Z","title":"Chunkattention: Efficient self-attention with prefix-aware kv cache and two-phase partition","venue":null,"work_id":"f555b084-a556-4195-9106-ada09956a485","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2402.15220","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:b89384d84b7218332fffe94e1c619bed0391e98fc351af0dd1334fc1d30dd2ab","observation_id":"15a4b487-9e26-478c-9c62-a13b250ca0c4","resolution":{"observed_at":"2026-05-12T08:20:01.172272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating self-attentions for llm serving with flashinfer, February 2024","venue":null,"work_id":"5c287574-ff86-479f-ae17-f374ad604f0d","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:bcb46bce7e5ca498d42a7886b3d7a160b9df7d471e043a2976105f0005bfd26b","observation_id":"8f022368-f493-4cc7-863c-594ca2e0963c","resolution":{"observed_at":"2026-05-12T08:20:01.215360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":"ac026f38-3dd9-456e-b9e3-8c7945bb3f72","year":2022},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:50adf33b3caa172e842e14ce4e73f835fc15b7d70b4f541e6d5edaa1a6773963","observation_id":"13e324ef-f3f6-4ab6-b7ae-664bf3524902","resolution":{"observed_at":"2026-05-12T08:20:01.218909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pages 4791–4800","venue":null,"work_id":"6da1ec70-1d9d-4749-8940-c499f21a1f24","year":2019},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:898aaef43c73c080a9c8a28de1aca33050b746b65a3edf32dcf66cc1da51fe4c","observation_id":"cb642d8f-19a2-4f52-9d32-21eb415a57ea","resolution":{"observed_at":"2026-05-12T08:20:01.222798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"prefill\"). It then sequentially decodes output tokens, with each token depending on prior tokens (this process is called","venue":null,"work_id":"3e8f8d4c-11b6-414a-850f-dcfa27fbe420","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:5075c446c43eb0fec92fef6c9c88fb5f0db971701623b1647148dc1b5e17983d","observation_id":"cc89d572-cdb3-4a1c-8ad9-2c4b34fb3883","resolution":{"observed_at":"2026-05-12T08:20:01.226418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":22,"verified_fuzzy":35},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 100 inbound Pith citation observations for arXiv:2312.07104."}