{"as_of":"2026-08-21T15:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd5284d2a474d3d1164f1eca1bfea7957ee77ada6a17d44d0abb49535d322f3c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:55:04.355426Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.15763/citation-record","integrity":"/paper/2502.15763/integrity","json":"/paper/2502.15763/citation-record.json","paper":"/paper/2502.15763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.247328Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.247328Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:e083e10b474241c9634625ed775f91c47914dd7397887d6b413f6f4eddbd39cf","observation_id":"ec4585e5-84c2-4920-865d-64c0a125d9be","resolution":{"observed_at":"2026-08-07T18:55:04.247328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.251658Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.251658Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:7d54e66bd614984322050d0f8dead6e1738824a0b6e3f371506819907bf1ecd9","observation_id":"63f79b81-13e9-4886-9dc2-16b15356ebf1","resolution":{"observed_at":"2026-08-07T18:55:04.251658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.626994Z","title":"NVIDIA Announces Financial Results for Fourth Quarter and Fiscal 2024,","venue":null,"work_id":"916edd58-3749-49b1-a8ce-edfde3c9d209","year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.255137Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:c79fec5852fb4a300020bf36dffe1efa2ef5110306b0046ea0f010df2fda2e55","observation_id":"5d34f8df-52dc-4982-b129-85a6998b33a8","resolution":{"observed_at":"2026-08-07T18:55:04.630193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02310","last_updated":"2024-06-17T21:10:46Z","snapshot_observed_at":"2026-08-20T05:02:40.492162Z","submitted_at":"2024-03-04T18:47:08Z","title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02310","snapshot_observed_at":"2026-08-07T18:55:04.258838Z","title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.258838Z"},"links":{"cited_paper":"/paper/2403.02310","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:e6d7bd66367cbe0ac5df0ac8169729416a2396e5163b3183b8ae628d4fb000b8","observation_id":"4e8fa402-4777-446f-996c-6d17079cd198","resolution":{"observed_at":"2026-08-07T18:55:04.258838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03243","last_updated":"2024-06-05T13:20:18Z","snapshot_observed_at":"2026-08-19T21:57:15.139367Z","submitted_at":"2024-06-05T13:20:18Z","title":"Llumnix: Dynamic Scheduling for Large Language Model Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03243","snapshot_observed_at":"2026-08-07T18:55:04.262738Z","title":"Llumnix: Dynamic scheduling for large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.262738Z"},"links":{"cited_paper":"/paper/2406.03243","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:ca5a0e024b7318fd832210198d62983924ea014e97bf186e85e604ddfccb3e81","observation_id":"a2107f8d-b8b7-4e61-ab44-c7932de99b71","resolution":{"observed_at":"2026-08-07T18:55:04.262738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.266415Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache manage- ment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.266415Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:54d39c84a3c9d37145ca1c674756463d4d2d3c856d251907c79ce3ecac794574","observation_id":"26fdc164-e8ec-4580-8b0b-10d9aacad476","resolution":{"observed_at":"2026-08-07T18:55:04.266415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.269646Z","title":"{dLoRA}: Dynamically orchestrating requests and adapters for {LoRA}{LLM} serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.269646Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:145d8c583acb57e826944cae024f749d707304c09f1a8502e4100730afb8dac4","observation_id":"ebd6cff6-6b2b-4c88-8ba0-cc7ff836ad7d","resolution":{"observed_at":"2026-08-07T18:55:04.269646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.272430Z","title":"Fairness in serving large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.272430Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:a86e8c41c444baf0cd2d7a53fa6e1d7b3b20d3f1f198812c177ab9c066da44b2","observation_id":"217c071e-2182-432b-b3ae-446d1a85b001","resolution":{"observed_at":"2026-08-07T18:55:04.272430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-20T11:37:26.614947Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-07T18:55:04.275192Z","title":"Fast distributed inference serving for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.275192Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:b0f6b2c3cfeeae609c34aeb0f9fd40e5735b7d7dda051ba90502e580d225e83c","observation_id":"a3bcd99a-78b5-4f9d-833d-58e845c4ca66","resolution":{"observed_at":"2026-08-07T18:55:04.275192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.602258Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"d45d5fc4-67dc-4dc3-b09c-87d3702dbc45","year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.278374Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:765a204c72ba220a21966e66adb89f0357d7a6ab34dd42dc1bbe9d8f0b2b1a27","observation_id":"7b6b5e0a-91e0-4a1d-b752-c6ca16e455ee","resolution":{"observed_at":"2026-08-07T18:55:04.605687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.281167Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.281167Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:b47334ee5c6f8842db3b70c7e8a097bae539817df2a600f1342b126f4b0b5d29","observation_id":"ed1c43cf-2700-4225-b701-1a38c196612e","resolution":{"observed_at":"2026-08-07T18:55:04.281167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T18:55:04.284157Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.284157Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:d42e9dfe8c047d7d701b922061fce406c4844d6e84b6d7b409c0c21595bd6967","observation_id":"823abd1b-c07b-4383-92d5-c8851d0c2391","resolution":{"observed_at":"2026-08-07T18:55:04.284157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.587849Z","title":"Sparsellm: Towards global pruning of pre-trained language models,","venue":null,"work_id":"32a22f50-772f-4893-b4a0-027d7a31f4df","year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.287314Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:a1baad9dcebe815eac15b32b2a99482ca0cbd489540efdac945fa83797ea2685","observation_id":"f65b6bef-05a6-489f-9a6a-62826fc87103","resolution":{"observed_at":"2026-08-07T18:55:04.591216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T18:55:04.290035Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.290035Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:d6078ac283f2793c123783bad9383678bbdbb91345addfb94b280428cd1ffce8","observation_id":"7f8e762f-27f7-4f02-b404-e7c7af33c6c9","resolution":{"observed_at":"2026-08-07T18:55:04.290035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T18:55:04.293244Z","title":"Fast transformer decoding: One write-head is all you need,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.293244Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:2c8a1cf9fe32b14f950bde45bec6a0a6edcafe9a451d20c307b25e7828203dc1","observation_id":"107e4a54-c0db-4ab5-af3d-448ba831ddb7","resolution":{"observed_at":"2026-08-07T18:55:04.293244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T18:55:04.296963Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.296963Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:a70d7c3185fe0bdaced08e7be2d9d88055494ce5d50daf5de406f785c9700d83","observation_id":"24055fa7-e84d-4ca6-890e-34633648d845","resolution":{"observed_at":"2026-08-07T18:55:04.296963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.301223Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.301223Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:4ff2f4506000e9360d2951d72a8c49a4cd8df28b7747a944ebe52f95aca68675","observation_id":"c5c2018f-f620-41fc-933b-7130c305012f","resolution":{"observed_at":"2026-08-07T18:55:04.301223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.573108Z","title":"Gpipe: Easy scaling with micro-batch pipeline parallelism,","venue":null,"work_id":"8b112674-49fb-4a7b-aec7-08c837d6fc0b","year":2019},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.304314Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:c7128cef018c489a09341b785823f337b825e8af077132c4dd393de8994879c2","observation_id":"8d97fafc-e9a8-493e-b97a-1ba3dfd2933c","resolution":{"observed_at":"2026-08-07T18:55:04.576513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T18:55:04.307566Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.307566Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:f6c8a274775edd419069730d196ca32b9cac7f9391583cfdd970d0ab41f31267","observation_id":"4d92bd38-203e-4592-8366-78d03d20d628","resolution":{"observed_at":"2026-08-07T18:55:04.307566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.563964Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":"95c86348-b713-43eb-bec8-31a89c4bdd87","year":2023},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.311288Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:9d86db364ae1f71a69ca4bb7a30f2c7bf18715427e5c6f6a1912e075f984cd9d","observation_id":"205fc4b0-30e8-4e9f-b287-5ade9ebdc7fc","resolution":{"observed_at":"2026-08-07T18:55:04.567209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T18:55:04.314448Z","title":"Ring attention with blockwise transformers for near-infinite context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.314448Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:f4b75d10ce4dbc4d2bbe217df1bbbc30ef3beed842ae6f629b5d25a89f08cafa","observation_id":"7dfe8a2d-538a-4e54-b789-7bdbb4f56be1","resolution":{"observed_at":"2026-08-07T18:55:04.314448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.317745Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.317745Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:e4bac32ca2bc06df3aa2991ef072721fe38ce7891cb57ac41cedc17b795a93cb","observation_id":"b6e1049c-ed18-4882-80fb-70cdc048af05","resolution":{"observed_at":"2026-08-07T18:55:04.317745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.320856Z","title":"Fast inference from transform- ers via speculative decoding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.320856Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:e4c9164dc7fb6469296942173c2b4ec29dd778b455db0bebe607de5216ca849e","observation_id":"32072092-3d38-486d-81a2-bf588d04d3d4","resolution":{"observed_at":"2026-08-07T18:55:04.320856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T18:55:04.323833Z","title":"Accelerating large language model decoding with speculative sam- pling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.323833Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:c2e863e8a3f977b1afbd6a76272988fe086e329489ddc45ab97de6a2589a5a16","observation_id":"e40bfe89-6d39-4759-af7e-92a886af9f78","resolution":{"observed_at":"2026-08-07T18:55:04.323833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.327290Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.327290Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:95ad3971c3d835bd3e1d6202b34d5733d7a1776025791477596aa76750861011","observation_id":"44d01514-e713-48a2-b989-d6811b0121fa","resolution":{"observed_at":"2026-08-07T18:55:04.327290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-16T14:25:57.735259Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-07T18:55:04.330334Z","title":"Inference without interference: Disaggre- gate llm inference for mixed downstream workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.330334Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:535b45dcf7f4c0b293811e1668110ff61d8b8798041d38b2049a46a4610dd1c3","observation_id":"bf3a698b-6d10-4bad-bedf-03331e1c72c7","resolution":{"observed_at":"2026-08-07T18:55:04.330334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-07T18:55:04.333568Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.333568Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:fdfa2d7ddefa8a0184bd4079d17025bb2163c62fd4c0d337f4ad06da6ff2eb0d","observation_id":"91da8edb-25d0-4524-bc2e-f0c338051bc0","resolution":{"observed_at":"2026-08-07T18:55:04.333568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-17T18:39:57.612444Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-07T18:55:04.337027Z","title":"Moon- cake: A kvcache-centric disaggregated architecture for llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.337027Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:c009929cdb48dc317e5616e37a7466df13cb92bd79a2ff266551fbca5407efd7","observation_id":"fd3f04f4-9b2c-4b92-9c97-d860bc8f9eb7","resolution":{"observed_at":"2026-08-07T18:55:04.337027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.537857Z","title":"Print surface thermal modeling and layer time control for large-scale additive manu- facturing,","venue":null,"work_id":"4bb81e23-15c4-42dd-8e9d-074191ca9063","year":2020},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.340598Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:8a94f35f750aca34ad50f7e1855ab55d57e4bbde9f35e219b23086f09fac5f41","observation_id":"2ea1a0e1-949a-495b-a9cf-decd88342df5","resolution":{"observed_at":"2026-08-07T18:55:04.541190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.528639Z","title":"Surgery scheduling under case cancellation and surgery duration uncertainty,","venue":null,"work_id":"21740c92-1b93-4fe4-9c4b-c6508f70a56e","year":2018},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.343558Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:21f12594fd11ddb6ec92e826c7ea35ea1d0a7fb68357e07d9fdac704b8f3f389","observation_id":"511422f8-4566-4ff9-8e02-3fa4f0181b00","resolution":{"observed_at":"2026-08-07T18:55:04.531937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.519210Z","title":"Online appointment sequencing and scheduling,","venue":null,"work_id":"83d6e2d4-4c27-48d8-8445-baad7ef48d7c","year":2015},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.346744Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:8dc52bee6497a033fb9a497e49222613cd1aad91ff2d5e3f0bb2a89b37e08463","observation_id":"be03ed37-ee6e-469a-af1d-1cc1bfa93f56","resolution":{"observed_at":"2026-08-07T18:55:04.522557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.509901Z","title":"A dynamic sequential decision- making model on mri real-time scheduling with simulation-based opti- mization,","venue":null,"work_id":"3e483d1d-4eef-46d7-a78d-3eded2f200b5","year":2022},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.349497Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:a3e737fd73888ed3d9b3a65510374ceb23c479147ffe24d1f4a8d7d3b47574ca","observation_id":"59ab1e9d-8c59-4396-9b79-99006beebba4","resolution":{"observed_at":"2026-08-07T18:55:04.513317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:55:04.497724Z","title":"Online scheduling of ordered flow shops,","venue":null,"work_id":"6d7a0673-8fad-47d4-8aab-e6c1d1af8a2f","year":2019},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.352473Z"},"links":{"citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:488a120477828ac5fb16b4bf7df75ac2573485fca8bd4790b0e6ea37d31450c8","observation_id":"9df9f3c7-785b-43cc-bb9e-9b3aca5dabf1","resolution":{"observed_at":"2026-08-07T18:55:04.503561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T18:55:04.355426Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T18:55:04.355426Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.15763"},"observation_digest":"sha256:8b206a35a81b8f280193a3aaf3c9750dedb34e8f3e2c61da770c99ff43c19be5","observation_id":"fcff8344-4f85-46d3-a7b6-1cb35329bc14","resolution":{"observed_at":"2026-08-07T18:55:04.355426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.15763","last_updated":"2025-02-14T16:00:00Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-15T07:38:25.170084Z","submitted_at":"2025-02-14T16:00:00Z","title":"Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2502.15763."}