{"as_of":"2026-08-19T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7c269d71420084086a616ba7f840e9a69da91ad25ea247e7c20c33dad6da6e0","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:42:24.754153Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08382/citation-record","integrity":"/paper/2608.08382/integrity","json":"/paper/2608.08382/citation-record.json","paper":"/paper/2608.08382"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.665709Z","title":"Amazon EC2 Instance Types – Burstable Performance Instances (T3)","venue":null,"work_id":"83527d93-7255-438d-8ec6-040eeac53029","year":2023},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.558207Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:b18009480be1aa9f16129bdb8605a3343a076f152a7f6930117a2faf1cff1e63","observation_id":"d9a16fe4-8913-40d9-9507-fc9a7cbf5576","resolution":{"observed_at":"2026-08-14T04:42:25.695693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.503078Z","title":"Anthropic API.https://www.anthropic.com/api, 2025","venue":null,"work_id":"96c28b76-da0d-4e4f-b6aa-b66e1a8d8e73","year":2025},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.563235Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:afc104693a0cbbb5baeeb07cf55a4ed6eee4aeb266e9d97851b285a08e3f2fdd","observation_id":"b16004a4-1535-4515-8710-48f1cd614722","resolution":{"observed_at":"2026-08-14T04:42:25.534772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.440565Z","title":"Xen and the art of virtualization.ACM SIGOPS operating systems review, 37(5):164–177, 2003","venue":null,"work_id":"1269a98d-c39f-4907-b789-f000c684f0ba","year":2003},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.567834Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:43313edff5ac38ef9cb41acedf8191bd23623a1c5998b16bf9acddfbb48ce0e4","observation_id":"e963fe0b-4c44-4bec-8014-3b1f40675fd7","resolution":{"observed_at":"2026-08-14T04:42:25.449733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-14T04:42:24.571959Z","title":"On the opportunities and risks of foundation models.arXiv preprint arXiv:2108.07258, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.571959Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:4ed2fad7087a236c7c17216e8cf415afbbf93f9423e0b60205e7022423059ec2","observation_id":"de6244fb-1abf-4d20-b503-d4a1b53c0793","resolution":{"observed_at":"2026-08-14T04:42:24.571959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-14T04:42:24.577605Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.577605Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:5eb2a38046284a8b5726bc0a5a0c38c2e213d4088bca79aaaa337b1657066be8","observation_id":"98058cc8-0fe4-494f-8816-2ade85e32230","resolution":{"observed_at":"2026-08-14T04:42:24.577605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.400026Z","title":"Predicting llm inference latency: A roofline-driven ml method","venue":null,"work_id":"5014e219-957a-4d2a-a8e5-109c43700c1b","year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.583654Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:5549498df85d35056e8337cf8ed05e6272a30b42582ac051394a86084f179709","observation_id":"ed21b4eb-dfbf-493c-b345-40da02c721f2","resolution":{"observed_at":"2026-08-14T04:42:25.430409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-14T04:42:24.599303Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.599303Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:1ca8eb759ec4d8d643ffd7088675f6d49e1fc31d35fc3d804eab42d7e0a34006","observation_id":"41ddca52-034c-4ff7-beaf-bc799f2b5df1","resolution":{"observed_at":"2026-08-14T04:42:24.599303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.348857Z","title":"Plato: Plan to efficient decode for large language model inference","venue":null,"work_id":"7cff9398-f64f-4b86-917c-f25f2a40333b","year":2025},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.611338Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:4221cef6cdaec1fd8dcfa2b5ce961cbbb2ce497ce11732460246acf6558e0984","observation_id":"03a6f21d-fa99-4fab-ab9d-a605b9afa755","resolution":{"observed_at":"2026-08-14T04:42:25.353397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03065","last_updated":"2025-02-20T23:28:01Z","snapshot_observed_at":"2026-08-18T10:16:17.240901Z","submitted_at":"2024-10-04T01:11:09Z","title":"Compute Or Load KV Cache? Why Not Both?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03065","snapshot_observed_at":"2026-08-14T04:42:24.617477Z","title":"Compute or load kv cache? why not both?arXiv preprint arXiv:2410.03065, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.617477Z"},"links":{"cited_paper":"/paper/2410.03065","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:91446f76c34192c43e0f27d6ee970f5252c5f2fac3e56c2a33c6d72321f58d87","observation_id":"f65ed111-c9b3-4c86-bf3e-cc00fed2f664","resolution":{"observed_at":"2026-08-14T04:42:24.617477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.334748Z","title":"s3: Increasing gpu utilization during generative inference for higher throughput.Advances in Neural Information Processing Systems, 36:18015–18027, 2023","venue":null,"work_id":"0065236a-2286-4bb2-97d3-390c611785cf","year":2023},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.627354Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:6f6f8a365ce68400e32f096574ecdfff2ac2fb9c5d03e665a563f0702ae8d208","observation_id":"92a87986-2028-40cb-b234-198314006b62","resolution":{"observed_at":"2026-08-14T04:42:25.340557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-14T04:42:24.655668Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.655668Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:828fc145cbfcd1c000bed6df726d8b53ed9f16c7222515a6bf2db743b44ea3b3","observation_id":"7687dbd3-5195-445c-a1a1-5564dab4481d","resolution":{"observed_at":"2026-08-14T04:42:24.655668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.288273Z","title":"Cgroups.Available on-line at: http://www","venue":null,"work_id":"327bbfc0-deb3-41f5-84f5-aec91e9bcd79","year":2008},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.660374Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:d6b5920b88807444d2e46de01d8f7f274334e3fa05728ec489f4e63d0f0f46e3","observation_id":"bcffb26d-7b89-4587-9b70-57120cafd825","resolution":{"observed_at":"2026-08-14T04:42:25.294760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.213633Z","title":"Docker: lightweight linux containers for consistent development and deployment.Linux j, 239(2):2, 2014","venue":null,"work_id":"51273e3e-5059-4f03-ac91-a029fbb77600","year":2014},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.664605Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:f9bae9a4d1b7421731841c57a7806353fcd827144ecc79ca8b9e88a0efa0fcc4","observation_id":"d6eaa769-159d-467f-b7b3-6e240984dc41","resolution":{"observed_at":"2026-08-14T04:42:25.239920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.152409Z","title":"Introducing llama 3.1: The next generation of open models","venue":null,"work_id":"7c896590-eb74-42e5-912d-504d2156a15e","year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.668261Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:b1366bd0dac41c2b891be50763f0436473f22d530f716409a9e49bcb62b9ee7b","observation_id":"8c9f05d0-ed81-4908-a366-f7cc6d4c337d","resolution":{"observed_at":"2026-08-14T04:42:25.174750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.111888Z","title":"NVIDIA Multi-Instance GPU (MIG) User Guide","venue":null,"work_id":"0c42bad2-1d08-4177-b4f2-d7029710aa74","year":2025},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.671996Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:acc5ee8b3be4a70b5906d39532f5fd130fc527f4596f471c8c8db297ebcbfb02","observation_id":"d9f7c4b6-7752-4e4b-936e-b4bbd6d43ca0","resolution":{"observed_at":"2026-08-14T04:42:25.134749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.071728Z","title":"OpenAI API.https://openai.com/api/, 2025","venue":null,"work_id":"5f2b8510-9957-4d07-8853-764eff291291","year":2025},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.676161Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:86143cffd85d2b45ac71315898c83f601f2895ce9f125c8f246cb7dadb5650ac","observation_id":"ea971a8b-95b7-4af9-993e-95a112d112c3","resolution":{"observed_at":"2026-08-14T04:42:25.080487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:25.053169Z","title":"Fairness in serving large language models","venue":null,"work_id":"92be6d22-8cf7-4167-8a3b-c1835fbd9dc6","year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.680943Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:1263ad8eddd5f256a6db74d0b29b00c88d0918c1aa26adc3e0844fe0eb87e1b9","observation_id":"d9a830fd-438d-4493-a156-12e5b7c64d9f","resolution":{"observed_at":"2026-08-14T04:42:25.059925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:42:24.685389Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.685389Z"},"links":{"citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:06b6e646fde387ed377124293c2957b836168f8d20b34089558c056528073052","observation_id":"0ea71899-891b-4a5c-90a5-00c332b866c0","resolution":{"observed_at":"2026-08-14T04:42:24.685389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03648","last_updated":"2025-02-22T07:07:38Z","snapshot_observed_at":"2026-08-16T12:56:09.968871Z","submitted_at":"2025-02-22T07:07:38Z","title":"AIBrix: Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03648","snapshot_observed_at":"2026-08-14T04:42:24.689292Z","title":"Aibrix: Towards scalable, cost-effective large language model inference infrastructure.arXiv preprint arXiv:2504.03648, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.689292Z"},"links":{"cited_paper":"/paper/2504.03648","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:649861098a7567a1599224fb6fe0a51a023997633c2201d12590d928e3ecee7a","observation_id":"242832dd-cf0d-41fc-8950-beaf09c15ab0","resolution":{"observed_at":"2026-08-14T04:42:24.689292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03871","last_updated":"2025-04-04T18:55:52Z","snapshot_observed_at":"2026-08-16T12:43:51.820341Z","submitted_at":"2025-04-04T18:55:52Z","title":"HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03871","snapshot_observed_at":"2026-08-14T04:42:24.697781Z","title":"Hetermoe: Efficient training of mixture-of-experts models on heterogeneous gpus.arXiv preprint arXiv:2504.03871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.697781Z"},"links":{"cited_paper":"/paper/2504.03871","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:a78bf85b5a26be91961fa23d794fa6f09e9b82ae8adee1888b81729ff7ff8a5f","observation_id":"4bbb7180-67a2-4bba-8b33-34fd237eb44a","resolution":{"observed_at":"2026-08-14T04:42:24.697781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-08-15T07:55:54.310165Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.19225","snapshot_observed_at":"2026-08-14T04:42:24.724753Z","title":"Rlboost: Harvesting preemptible resources for cost-efficient reinforcement learning on llms.arXiv preprint arXiv:2510.19225, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.724753Z"},"links":{"cited_paper":"/paper/2510.19225","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:dcf0db06584e518bc58fc622e0f21704d64e924a108218859bf891b4078e92d6","observation_id":"884f6640-65be-4964-9c1f-d5909c70f64a","resolution":{"observed_at":"2026-08-14T04:42:24.724753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-18T23:15:35.529250Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-14T04:42:24.748447Z","title":"Llm inference unveiled: Survey and roofline model insights.arXiv preprint arXiv:2402.16363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.748447Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:40296ea3ccf86dc442d1f6ae0f66ccf9e603571bbf56184b0f800ecd02efb9ba","observation_id":"768fbee0-c871-44cd-9440-f7b38a176288","resolution":{"observed_at":"2026-08-14T04:42:24.748447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15518","last_updated":"2024-10-29T00:20:45Z","snapshot_observed_at":"2026-08-16T13:16:06.274919Z","submitted_at":"2024-09-23T20:10:10Z","title":"Eagle: Efficient Training-Free Router for Multi-LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15518","snapshot_observed_at":"2026-08-14T04:42:24.754153Z","title":"Eagle: Efficient training-free router for multi-llm inference.arXiv preprint arXiv:2409.15518, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:24.754153Z"},"links":{"cited_paper":"/paper/2409.15518","citing_paper":"/paper/2608.08382"},"observation_digest":"sha256:4f73ed6232b1f1ef7d67f06760612d1b12b955da2bd0306ef71ab5cfcb525d2a","observation_id":"759bacf0-3e8e-4c02-b100-4947e78a16ef","resolution":{"observed_at":"2026-08-14T04:42:24.754153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08382","last_updated":"2026-08-09T00:28:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T04:13:00.114493Z","submitted_at":"2026-08-09T00:28:05Z","title":"LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.08382."}