{"as_of":"2026-08-09T23:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34260b4b033f83e2b2eda40b00462e0870dc4a06c7e33ed1307a2f85b5e1e63c","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:23:08.569863Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06007/citation-record","integrity":"/paper/2608.06007/integrity","json":"/paper/2608.06007/citation-record.json","paper":"/paper/2608.06007"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.210099Z","title":"https://www.kimi.com/blog/kimi- k3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.210099Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:61d4d3ded574984a5f7dfccd09d71ac984f215ba49807a6afe44a535ee73b585","observation_id":"7266694b-2167-460e-a9a2-c6a1461ddcae","resolution":{"observed_at":"2026-08-07T18:23:08.210099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.215746Z","title":"ServerlessLLM: Low-Latency serverless inference for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.215746Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7b43313c14dce3197f07c7e16acae8fcf7dec85fb0f74310e91cf7d97ddeaa48","observation_id":"c5640c60-ddb8-46c0-820b-289b6a800bd5","resolution":{"observed_at":"2026-08-07T18:23:08.215746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.220987Z","title":"Deep- flow: Serverless large language model serving at scale.arXiv e-prints, pages arXiv–2501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.220987Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c9fb64fb9e26ee6c79e046735ff308b35338c9d4f32a4da02dc009478db8c6c7","observation_id":"d373c80b-505e-4110-9072-7ef34e468468","resolution":{"observed_at":"2026-08-07T18:23:08.220987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03622","last_updated":"2025-07-08T02:15:07Z","snapshot_observed_at":"2026-07-06T15:39:10.697564Z","submitted_at":"2023-06-06T12:19:05Z","title":"Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03622","snapshot_observed_at":"2026-08-07T18:23:08.225722Z","title":"Faaswap: Slo-aware, gpu-efficient serverless inference via model swap- ping.arXiv preprint arXiv:2306.03622, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.225722Z"},"links":{"cited_paper":"/paper/2306.03622","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:fa943dcdcfe09722863a49f5aa625779d5ad69b3451a133a84196218f8b25557","observation_id":"059a9267-99f7-4671-b484-7768bf48ee96","resolution":{"observed_at":"2026-08-07T18:23:08.225722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.230680Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.230680Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:cda7fb58592b9cb478925b322c649c0d6ca07fd939d4461bbdca635050d8de43","observation_id":"7bb633c6-8d07-43e5-a398-f51152382d11","resolution":{"observed_at":"2026-08-07T18:23:08.230680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.234958Z","title":"BlitzScale: Fast and Live Large Model Autoscaling with O (1) Host Caching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.234958Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d8c95aac4de041276c6cd5110e39f1b3eb15bb34f61e458afe1ae22761dc6794","observation_id":"e4436a8a-eac5-4d58-a312-6f25afa6d915","resolution":{"observed_at":"2026-08-07T18:23:08.234958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.239382Z","title":"Hydraserve: Minimizing cold start latency for serverless llm serving in public clouds.arXiv preprint arXiv:2502.15524, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.239382Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:05ce9a577dc755a5e26b992549c0c6e1eafe304e1923faae0ebe3a777e489ae9","observation_id":"4c447d41-9049-42d6-a526-314478418a4a","resolution":{"observed_at":"2026-08-07T18:23:08.239382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.243347Z","title":"https://lmsys.org/blog/2025-12-10-rfork/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.243347Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:acb3bda915b851e48ce09d5eddade003f621b4f7798e11b57106217071594ffd","observation_id":"cff16d1b-78d6-4d53-afdf-1a465b2f75e0","resolution":{"observed_at":"2026-08-07T18:23:08.243347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.247723Z","title":"Mooncake: Trad- ing more storage for less computation—a KVCache-centric architecture for serving LLM chatbot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.247723Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3b17cbdeca55c0f670204c2d57cb3e6365bf39062e7426896ffc0c4400967f90","observation_id":"9012b892-fc8d-46fe-9e9a-83c5ef0d592a","resolution":{"observed_at":"2026-08-07T18:23:08.247723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.252135Z","title":"Dualmap: Enabling both cache affinity and load bal- ancing for distributed LLM serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.252135Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:6925ac275773d6076a3a34ba0f6da0af67ecd59d93e3ad4ceacd7190561c33e6","observation_id":"214672d2-ef54-4bbc-9f95-a8ecd3432886","resolution":{"observed_at":"2026-08-07T18:23:08.252135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.256927Z","title":"Lmcache: An efficient kv cache layer for enterprise-scale llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.256927Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:0e7df6161913733b9178808a2fc0dbebf4542d4368e14ebba392bbf10937ae70","observation_id":"530077e3-3828-4a3b-8d88-67308194f45b","resolution":{"observed_at":"2026-08-07T18:23:08.256927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.261289Z","title":"https://lmsys.org/blog/2025-09-10-sglang-hicache/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.261289Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c48121f64e069f542c55932153f464b4878ffa71b563985e131435e1a7b6fd9a","observation_id":"1bab6d33-92c7-4dee-8e00-57df7e7504a8","resolution":{"observed_at":"2026-08-07T18:23:08.261289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.643159Z","title":"Stateful large language model serving with pensieve","venue":null,"work_id":"693b1091-7e39-4fa6-9f4b-00e628f88235","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.265567Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:2d5ebd77c1b55038cd545ca18517bfb97c65d8292298a2e66ca56d253066b6ac","observation_id":"42f290ec-4062-48e3-bfca-971efb32b231","resolution":{"observed_at":"2026-08-07T18:23:10.647674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.631960Z","title":"Cacheblend: Fast large language model serving for rag with cached knowledge fusion","venue":null,"work_id":"1aa3cc90-5684-4e0a-98a3-6123c9829b15","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.270101Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:6d0fcf8ae3144ce6f069a611397861021fdd765165c8837986ede91b53ffed06","observation_id":"9194a7a9-2f73-4e9c-b28f-1f56071a2766","resolution":{"observed_at":"2026-08-07T18:23:10.635789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.620584Z","title":"Cost-Efficient large language model serving for multi-turn conversations with Cache- dAttention","venue":null,"work_id":"7dfd4f60-16c4-4ac3-ac97-b2a278b83b8f","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.274263Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:400060bca870c698de184581598757ab06a033261a4fef585338bf4894529083","observation_id":"da5d784e-d1e4-4906-82b2-e611454f3ffb","resolution":{"observed_at":"2026-08-07T18:23:10.624659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.609354Z","title":"{ByteCheckpoint}: A unified checkpointing system for large foundation model development","venue":null,"work_id":"6d93d69d-25b7-4d69-8e3a-887dfc26cd59","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.278745Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:00fe4007a9a1f6e4730c318f240a45e67586f95fc9e9442d9cb1a9c0bc027e3e","observation_id":"7b20c028-7b9f-4073-9b77-231851ecc7da","resolution":{"observed_at":"2026-08-07T18:23:10.613146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.597311Z","title":"https://github.com/MoonshotAI/chec kpoint-engine","venue":null,"work_id":"f5da0a2d-6959-4516-a86e-c86f90369cc3","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.282891Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:b621b4847ba7f10e4a6c8e7950a442fd864168c420678798331810b2295011d1","observation_id":"4662b785-a21c-4aa6-a755-bec13fc799eb","resolution":{"observed_at":"2026-08-07T18:23:10.601572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.585375Z","title":"https://vllm.ai/","venue":null,"work_id":"9f2240a2-effa-4076-9db7-8a8987ce8e4a","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.286808Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:18d8ef8b7feae6eecf9a6986455ac645ab03c0c1b64d89e2f8fb6146bbc16b34","observation_id":"31c3bf0a-5caf-4897-8dfd-3bc84f726e13","resolution":{"observed_at":"2026-08-07T18:23:10.589655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.292156Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.292156Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:b2c7d6256f713c13dd1b4ea066ec3f118e2656a4000c44519343c4bfe8d67083","observation_id":"4559eff5-182a-4fde-b2db-6844d6b4eef1","resolution":{"observed_at":"2026-08-07T18:23:08.292156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.567163Z","title":"https://nvidia.github.io/TensorRT-LLM/","venue":null,"work_id":"677276d8-c74b-4ee6-bfe2-fae5ac135982","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.296384Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:9d775685ba384ca5625fbe882f94d5e326481cc18ebc3d7dcd61278df5424a52","observation_id":"f1a612b6-281d-44a8-966a-de5cd8b8260d","resolution":{"observed_at":"2026-08-07T18:23:10.571245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.554961Z","title":null,"venue":null,"work_id":"40401d33-c8da-4c11-aaa9-08ca16cdf9ac","year":null},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.300372Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:995cacb727acd46e7c58777e1555842c5536ca4ef1847923d359160dcbe3a472","observation_id":"88da8772-4852-4076-aeed-3d06e9d38c5c","resolution":{"observed_at":"2026-08-07T18:23:10.559915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.542322Z","title":"https://redis.io/","venue":null,"work_id":"b6e7b4f0-59c0-48b0-9a76-dcb7828e78f7","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.304346Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d6135761239151e9efc8299d95917828606f0cecc54edb24f4374503c282a9a6","observation_id":"db842daf-c122-4ea2-933e-7cb220a4e955","resolution":{"observed_at":"2026-08-07T18:23:10.546071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.530444Z","title":"Vineyard: Optimizing data sharing in data- intensive analytics.Proc","venue":null,"work_id":"ac64380a-29e7-45f1-bb01-d28c925620fe","year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.308377Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7839d1425cf7a74e08d2c291128fd46b74f418e6376afeebe37f1a552f3da750","observation_id":"e67a7a63-1040-4cf5-a8c1-e12cedf1315d","resolution":{"observed_at":"2026-08-07T18:23:10.534517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.517081Z","title":"https://github.com/ray-project/plasma","venue":null,"work_id":"2548e854-8f26-42d5-a095-b1438cbe4986","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.312295Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:5c563116f9fde2ff8ca3d883a5680fcbc6b8b765ae5b9f98d307faa8a788a26a","observation_id":"45e262c5-30d2-4c6f-be79-3d1fc74ab155","resolution":{"observed_at":"2026-08-07T18:23:10.522032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.505709Z","title":"Ray: A distributed framework for emerging ai applications","venue":null,"work_id":"d0fb6272-a6ab-408f-9212-ce5796f250a2","year":2018},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.315974Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:736da57f9ca35ae15d7e41803473eb38b2997cf6665bd7ffaee288366795f763","observation_id":"8436dcad-3029-4bdf-bb28-e3e864b50b22","resolution":{"observed_at":"2026-08-07T18:23:10.509673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.493268Z","title":"Resilient distributed datasets: A Fault-Tolerant abstraction for In-Memory cluster computing","venue":null,"work_id":"38a0e9a3-d83c-4556-9ea6-969c16cf2165","year":2012},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.320121Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:8e07caf3b294ff02cafaa2619ef2c599ca2522a01092b89bf89ba82283982e4d","observation_id":"76dc0904-c3ee-4e49-a3cb-3e5b4a919e09","resolution":{"observed_at":"2026-08-07T18:23:10.497933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.324667Z","title":"Serverless computing: Design, implementation, and performance","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.324667Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3b3aff7231383519e1a25094c12c54e5b0e8e77fcd188ffb70931b50bd65c6d5","observation_id":"0d236e8d-f09c-4621-b24c-a6a9d6cc73ed","resolution":{"observed_at":"2026-08-07T18:23:08.324667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.473954Z","title":"Infless: a native serverless system for low-latency, high-throughput inference","venue":null,"work_id":"77b3b745-8a0b-4b7d-9cbf-df5c044d567c","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.328764Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:77b0ea94ccdb4ac26fe9a513ef12694b02e45bee3965571298e244bbd6c567a4","observation_id":"b4725148-3cf4-48f3-bcf2-2e285e89f710","resolution":{"observed_at":"2026-08-07T18:23:10.478626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.332432Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.332432Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:71eae65c47b3355c355756be66a6d3e04e071c9389a8ade933c35a323159154d","observation_id":"61af6026-a968-4494-9880-29304696fc9d","resolution":{"observed_at":"2026-08-07T18:23:08.332432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.336296Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.336296Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:583e8a78a37d78426078df7eefd97d5fbe40353746850b2ce205d72c0cffa9bf","observation_id":"d04194b5-e4b6-438e-8cae-de4d804b89f0","resolution":{"observed_at":"2026-08-07T18:23:08.336296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.333855Z","title":"Flexkv: Flexible index offloading for memory-disaggregated key-value store.arXiv preprint arXiv:2512.16148, 2025","venue":null,"work_id":"ef7adfc7-0ed9-4824-acf5-de8fcc85cd41","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.339917Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:edbd7773fc11b1811f7a720c0e5fd1e0c1478343eaddabe9357ed9e8aba2f626","observation_id":"8c2c0de8-44a0-435c-8316-63e889a005a8","resolution":{"observed_at":"2026-08-07T18:23:09.340739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.446333Z","title":"In USENIX OSDI, 2024","venue":null,"work_id":"8d62ce17-6876-4198-813b-c9637f3bfd6d","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.344903Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:bb7633a705c82471a7aab17968ce1d95457217637f211762e7965ac7438926c7","observation_id":"770044c6-56af-42e6-a0b9-808c69d64444","resolution":{"observed_at":"2026-08-07T18:23:10.450965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.433562Z","title":"Splitwise: Efficient genera- tive llm inference using phase splitting","venue":null,"work_id":"7ff8fb8c-9652-47f6-8ab1-d7a916b5e462","year":null},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.348995Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e2d2c6334d2f365fff4aa1a929f4c5709c851b9907fbc723efa49aabaf5776c2","observation_id":"c0f22ded-c796-44de-a7ef-351c921e3fd7","resolution":{"observed_at":"2026-08-07T18:23:10.438704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-07T18:23:08.353271Z","title":"Inference without interference: Disaggregate llm inference for mixed downstream workloads.arXiv preprint arXiv:2401.11181, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.353271Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3849753606447abc9b9f67cc7ab93bbc5fcbe6b3f9ff4043e8849288b5fb9e19","observation_id":"ea77d351-5772-4605-b59d-d2342eac07e3","resolution":{"observed_at":"2026-08-07T18:23:08.353271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01876","last_updated":"2024-03-04T09:32:05Z","snapshot_observed_at":"2026-07-06T17:39:03.755444Z","submitted_at":"2024-03-04T09:32:05Z","title":"D\\'ej\\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01876","snapshot_observed_at":"2026-08-07T18:23:08.357426Z","title":"D \\’ej\\avu: Kv-cache streaming for fast, fault- tolerant generative llm serving.arXiv preprint arXiv:2403.01876, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.357426Z"},"links":{"cited_paper":"/paper/2403.01876","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:9a509938652f4207d921a6a83ddfba4d6878eb39662c1a658d5f932afa305f0f","observation_id":"60fe65b5-c7d9-437f-aa3f-c6cb4b316c79","resolution":{"observed_at":"2026-08-07T18:23:08.357426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.421639Z","title":"Prompt cache: Modular attention reuse for low-latency inference.Proceedings of Machine Learning and Systems, 6:325–338, 2024","venue":null,"work_id":"43425072-7c87-46a1-a14d-62b013573a6a","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.361591Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:8847a0c49df00afe1d593614beef9eec892362ad08bc55920789473a3fdeee87","observation_id":"e3d048ff-38d0-4f2e-9257-ef5544fc095f","resolution":{"observed_at":"2026-08-07T18:23:10.425673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.409795Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving","venue":null,"work_id":"971c2c7a-fcf0-4f00-81ce-7a3c5ed3ed7c","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.365396Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:dc7817d95949f46d11a2c3e03c5081391cdb073e61286886871f2105621a7d6c","observation_id":"bcc27414-be25-4ed7-90ec-d706b5fad965","resolution":{"observed_at":"2026-08-07T18:23:10.414206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.396553Z","title":"Ragcache: Efficient knowledge caching for retrieval-augmented generation.ACM Transactions on Computer Sys- tems, 44(1):1–27, 2025","venue":null,"work_id":"11689a65-a727-4ca0-86d0-55f855ba87ea","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.369036Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:4e224d9e8b5326a7132c21d584a423dec003a6c6b6e2774eabc52a34640c4038","observation_id":"1a8aac5a-b716-4e1a-b453-3e151a60595c","resolution":{"observed_at":"2026-08-07T18:23:10.401403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19708","last_updated":"2024-06-30T23:50:38Z","snapshot_observed_at":"2026-08-03T11:15:07.121206Z","submitted_at":"2024-03-23T10:42:49Z","title":"Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19708","snapshot_observed_at":"2026-08-07T18:23:08.373466Z","title":"Attentionstore: Cost-effective attention reuse across multi-turn conversations in large language model serving.arXiv preprint arXiv:2403.19708, 52:20–38, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.373466Z"},"links":{"cited_paper":"/paper/2403.19708","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:f4c20239c885ecb6318185ee34e37e605d406593a576dc0cc1805216641e59d1","observation_id":"573cad29-4ab0-4ad7-ae10-34ce8d5c21d4","resolution":{"observed_at":"2026-08-07T18:23:08.373466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.382237Z","title":"Dist checkpointing package","venue":null,"work_id":"3b19c140-284d-4699-907e-03cd3ffd3498","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.378063Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:880c4d85048191afdf7df2414c81e241609ea051125490f5e8c36cb75e81e619","observation_id":"254654b9-7c4a-46cd-95fe-2db36adfceca","resolution":{"observed_at":"2026-08-07T18:23:10.386334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.368426Z","title":"Getting started with Distributed Check- point (DCP)","venue":null,"work_id":"264c14a0-6c8f-4ba8-9117-eae917da892e","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.382598Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:797d18346e6e0e4cc1131912fd76c8a780e4bb576bf77fc16be34d742aa2d858","observation_id":"69313a8f-f463-45a8-ac16-3a10cb5bdf78","resolution":{"observed_at":"2026-08-07T18:23:10.373829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18820","last_updated":"2025-07-04T06:16:30Z","snapshot_observed_at":"2026-08-05T10:35:46.891754Z","submitted_at":"2024-06-27T01:28:30Z","title":"Universal Checkpointing: A Flexible and Efficient Distributed Checkpointing System for Large-Scale DNN Training with Reconfigurable Parallelis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18820","snapshot_observed_at":"2026-08-07T18:23:08.386378Z","title":"Universal checkpointing: Efficient and flexible checkpointing for large scale distributed training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.386378Z"},"links":{"cited_paper":"/paper/2406.18820","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:55cc1318f3cec55166e4ba6bd523ee411f077341b229999b6a86627b80f3309d","observation_id":"5f164233-bc05-4186-942a-ec60c49025d7","resolution":{"observed_at":"2026-08-07T18:23:08.386378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.355439Z","title":"Simple is better: Multiplication may be all you need for llm request scheduling","venue":null,"work_id":"ae254e82-9108-4542-a77d-5ec2918e0f70","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.390858Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:18386b9b53e81bcb22af889f001f13cbd3a0bd930a2c370ef543fa2a3f9a371e","observation_id":"9cfffabc-cb58-4e9a-b75f-bc7b8d852320","resolution":{"observed_at":"2026-08-07T18:23:10.359485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.343205Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"0717b09d-d989-4d01-a4e9-403b2bfd2b82","year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.394615Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7604ea915092ca9acafbd5eff0f033aafdd31e70458fe3c5d55bb7c2782e5e24","observation_id":"8a62c2a8-f310-4c44-aae6-6933689baeb9","resolution":{"observed_at":"2026-08-07T18:23:10.347609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.330642Z","title":"https://docs.vllm.ai/en/stable/desig n/prefix_caching/","venue":null,"work_id":"92f017e5-75b7-4950-b921-66b562fc72fa","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.398238Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:1d2be8d375c784370b4309f97c604610cfe7b657ec671dd9988b3c3217fdc1e9","observation_id":"48fdc530-c428-411c-87e2-112cddc9bfd4","resolution":{"observed_at":"2026-08-07T18:23:10.334793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.318828Z","title":"https://lmsys.org/blog/2024-01-17-sglang/","venue":null,"work_id":"08378bce-eaf0-41b0-a21c-ba251fe630b4","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.401764Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c6f827251fb2f1892a4cc4047a49ebb9440d245b57cd3313f3830999ccbdf056","observation_id":"2ec7bafd-e84c-4950-a29a-579d9f6908fa","resolution":{"observed_at":"2026-08-07T18:23:10.322790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.306493Z","title":"Pie: A pro- grammable serving system for emerging llm applications","venue":null,"work_id":"1c6e4904-9ae2-4752-bb18-2225bbe0cc80","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.405393Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c3aec3c51fda2bee245beccb4e2f6281534364348df3718e41ca74b88e64106c","observation_id":"aed7ed80-0a54-4021-9bad-50150fca6b34","resolution":{"observed_at":"2026-08-07T18:23:10.310698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.409426Z","title":"Chain-of-thought prompt- ing elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.409426Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:8e5917323c15760cfba39d3946db1502a9a9e04d99dd99c8094426d6e1cb2f15","observation_id":"2d7fe69a-4765-4fa5-a54c-4bd2caefbe3d","resolution":{"observed_at":"2026-08-07T18:23:08.409426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.412959Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.412959Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:ab8fdf6efe7e983be3c096a28d7a4c7bd5df911c55154bee6296c3983d668d03","observation_id":"4c63f9c8-ebc7-45d6-aa2d-1fb0fd3500ba","resolution":{"observed_at":"2026-08-07T18:23:08.412959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.277504Z","title":"Training language models to follow instruc- tions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":"642f9486-27b2-4d60-84ba-f46981d849bf","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.416940Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:0f51fe9f9bd2c0945880e443f81fe08e71c95213d8cea43eee6a5f128f121f91","observation_id":"60382737-0556-4911-ab3d-b66a51c7f2ec","resolution":{"observed_at":"2026-08-07T18:23:10.282711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14617","snapshot_observed_at":"2026-08-07T18:23:08.421353Z","title":"Seer: Online context learning for fast synchronous llm reinforcement learning.arXiv preprint arXiv:2511.14617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.421353Z"},"links":{"cited_paper":"/paper/2511.14617","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:57496d41a19dc81ee72d9e2e22fdb2709ec1a48a17c97bf51fa0b8d337a548db","observation_id":"4c583cb5-6425-44b7-82ee-ab34222e266e","resolution":{"observed_at":"2026-08-07T18:23:08.421353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T18:23:08.425755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.425755Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:4b5a08af323ae3c3eee555c302b122ce54e8d91279520e76ac4bccdda171628d","observation_id":"f8c235cd-4da4-4fe4-88dc-0cf04bcc8159","resolution":{"observed_at":"2026-08-07T18:23:08.425755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.430349Z","title":"Totrl: Unlock llm tree-of-thoughts reasoning potential through puzzles solving.arXiv preprint arXiv:2505.12717, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.430349Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:70c094a410d3f4169929cddbc619488890780c23e2e3b7d2e660b03dc6482d1b","observation_id":"2847fa79-e643-40e6-a65c-fb56839f6f7e","resolution":{"observed_at":"2026-08-07T18:23:08.430349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.264845Z","title":"Using name-based map- pings to increase hit rates.IEEE/ACM Transactions on networking, 6(1):1–14, 2002","venue":null,"work_id":"0d607f03-e09b-4d39-9777-b4d248afa5fd","year":2002},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.434044Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:4105948bf7298578eb5e0f69b11f1e0832e3edfeb86188b210327e95dc50ba0c","observation_id":"50a88b26-30cb-4888-a5af-cec5627c30a6","resolution":{"observed_at":"2026-08-07T18:23:10.269755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.438822Z","title":"Paxos made simple.ACM SIGACT News (Distributed Computing Column) 32, 4 (Whole Number 121, December 2001), pages 51–58, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.438822Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:691fca910d4f993546c30607d49ff06f2c3a997405531e85b4eb47c5822b3b44","observation_id":"006bb2b3-6cfd-4972-844b-26a05685227f","resolution":{"observed_at":"2026-08-07T18:23:08.438822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.245499Z","title":"In search of an understandable consensus algorithm","venue":null,"work_id":"27b222e9-915a-435b-b743-83e8e50545bb","year":2014},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.442644Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:c3df8506b5be9cd0bf50c11e0839cb5c0c6a8c2711cdb2e45c3a3392f38e9489","observation_id":"32b178f7-8443-4441-b96b-3e37cc30c25a","resolution":{"observed_at":"2026-08-07T18:23:10.249413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.233203Z","title":"Chain replication for sup- porting high throughput and availability","venue":null,"work_id":"e938b9d5-a693-4607-a93d-4d5c840e27b9","year":2004},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.446537Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e3283588868035ae47596338d3d44f253ecb0c3d3f6bce0aff60c6e51be272d8","observation_id":"bbf2b854-54d3-4aaa-bb1d-fe5f9036b578","resolution":{"observed_at":"2026-08-07T18:23:10.238009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.220873Z","title":"Object storage on craq: High- throughput chain replication for read-mostly workloads","venue":null,"work_id":"ca03792b-72c9-484f-a5ea-d636df49f469","year":2009},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.450954Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:85fe661a916f7806f14953a567f6039f78a003d8c0cc13d0db38cca2387e049e","observation_id":"ff7f2fae-e973-42ba-8053-ca9eff8b8ff9","resolution":{"observed_at":"2026-08-07T18:23:10.224973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.206898Z","title":"https://duckdb.org/","venue":null,"work_id":"7bd40e1b-5001-474a-8b89-ef712769617e","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.454631Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:59cc66265dfd53f6ab6048ccb19d2a52133ce37e6273681bf987fcdfa1b3d40b","observation_id":"9168acd8-ed5d-4b95-8f5f-2019e44874c8","resolution":{"observed_at":"2026-08-07T18:23:10.211272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.194084Z","title":"mtcp: a highly scalable user-level tcp stack for multicore systems","venue":null,"work_id":"16165aaf-e388-41f9-8521-faee65a1b35a","year":2014},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.459162Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:f8cb899765cd43fff6b95290878aec88825215b9955e866d987bbb4d867342cb","observation_id":"53bf552d-21dd-4d45-a1ec-41026a92b6c8","resolution":{"observed_at":"2026-08-07T18:23:10.198701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.181418Z","title":"https://github.com/juicedata/juicefs","venue":null,"work_id":"fdc40910-54b6-4a06-b37f-c69ceb8fa36f","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.462909Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:54bac77b77b27c207df762df41873f490e23f7973c98b054faad1b174d6b4a4f","observation_id":"6a330889-e78c-40b5-9722-42ead742e5d1","resolution":{"observed_at":"2026-08-07T18:23:10.186247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.168775Z","title":"https://github.com/scitix/InstantTensor","venue":null,"work_id":"b28974d4-1806-4a47-a09a-d0e073432466","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.466659Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:81d5a678e7f2095d7edefea8affb132c81bc0a82aadff9534eda967f03d83a34","observation_id":"e5e4bb20-5e0d-4601-ba22-8341ef673049","resolution":{"observed_at":"2026-08-07T18:23:10.172944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.156517Z","title":"Long- bench: A bilingual, multitask benchmark for long context understand- ing","venue":null,"work_id":"08a113cc-0d28-4c4a-af97-df7d48d19d34","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.470342Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:7dd11f1cd5beef57173c4a321ac428a5a20649b60d7f3a1580265aa9c5dc64a6","observation_id":"3e039b24-fd2d-4026-b25b-8d5d812f2fed","resolution":{"observed_at":"2026-08-07T18:23:10.160803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15039","last_updated":"2026-04-22T03:05:12Z","snapshot_observed_at":"2026-07-06T23:02:40.364114Z","submitted_at":"2026-04-16T14:07:41Z","title":"Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15039","snapshot_observed_at":"2026-08-07T18:23:08.474373Z","title":"Prefill-as-a-service: Kvcache of next-generation models could go cross-datacenter.arXiv preprint arXiv:2604.15039, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.474373Z"},"links":{"cited_paper":"/paper/2604.15039","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d01e69fc41688d4fa06fc94867a336cabf812a7e3b3aea01f760af46afa88796","observation_id":"39ad49e7-c9ab-40df-ac0f-262f08e9d101","resolution":{"observed_at":"2026-08-07T18:23:08.474373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.143489Z","title":"https://docs.sglang.io/docs/advanced_feature s/sgl_model_gateway","venue":null,"work_id":"26b0f945-6c18-421d-93cf-a7a3f2d2ace8","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.478209Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:8625a1871ec36b0a8fcee1aaf7628ac08bc8c84c9d9a99a85a1e80124e5721a2","observation_id":"22a3cb25-dbb3-44a9-83a9-ba3209d9e25d","resolution":{"observed_at":"2026-08-07T18:23:10.147703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.131392Z","title":"The power of two choices in randomized load balancing.IEEE transactions on parallel and distributed systems, 12(10):1094–1104, 2002","venue":null,"work_id":"5d0bc1b6-de8a-4797-a9bd-ea4a244f92d0","year":2002},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.481823Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3dc8e549f1b86628c44581fb36226238810122559a5ccddd5049e86256b8972f","observation_id":"f82df5cf-a17a-497c-a3eb-179e3270f03c","resolution":{"observed_at":"2026-08-07T18:23:10.135851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.118849Z","title":"https://huggingf ace.co/datasets/SWE-Gym/OpenHands-Sampled-Trajectories","venue":null,"work_id":"099e7909-8860-459b-b4b6-6fc7cf25f0dc","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.486166Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:3c77bb031d872737d0c01ffacef382e3a64fa18a91d9182c06cfcc846fb8b675","observation_id":"916f0139-d982-41e4-9dda-0c918187b03b","resolution":{"observed_at":"2026-08-07T18:23:10.123576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.105156Z","title":"Statistical analysis of a telephone call center: A queueing-science perspective.Journal of the American statistical association, 100(469):36–50, 2005","venue":null,"work_id":"9c448de3-4043-4e2a-87b3-0c4ddb82fb7c","year":2005},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.489786Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d2a8c82831e45ad8b15aedb1cfb2cddf18ffb37ee5dab0927d05b383e4ff185c","observation_id":"ad3735ae-f21e-46a5-9c1d-c929ea663c71","resolution":{"observed_at":"2026-08-07T18:23:10.109945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.087444Z","title":"A poissonian explanation for heavy tails in e-mail communi- cation.Proceedings of the National Academy of Sciences, 105(47):18153– 18158, 2008","venue":null,"work_id":"2e101f8d-2ad7-4387-bb44-cd1e54275f93","year":2008},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.493268Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:b02c6a2f6b11aacb07c414cb1876aa4364643bd8b6ce9a9b94041f5ad366942b","observation_id":"50970dc1-da77-4f6d-87a2-d011f79d8682","resolution":{"observed_at":"2026-08-07T18:23:10.092229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T18:23:08.497271Z","title":"Megatron-lm: Training multi- billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.497271Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:747a38353f6d1fd4fc22429056472b7722373f4263a412f8c16e1a4628456b44","observation_id":"9da05baf-c805-45e5-b197-927e82cb80a7","resolution":{"observed_at":"2026-08-07T18:23:08.497271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.501915Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.501915Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:24f9f9a2b088fea20931ff37cedd73904aab4151ac77f5e6200ea2e16ee4f68d","observation_id":"7c371ba0-aef4-4f2f-9ba9-cc684d7c79ce","resolution":{"observed_at":"2026-08-07T18:23:08.501915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.065917Z","title":"Alpa: Automating inter-and{Intra-Operator} par- allelism for distributed deep learning","venue":null,"work_id":"c471a51c-ec14-4ec4-a249-e4ce68e71f2e","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.506285Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:cd2cff0552f9f661e587da83be060b3c515474ff7d593a0e0b30cc16ce147469","observation_id":"3f1f042e-f93e-4b13-97de-451d75f5d386","resolution":{"observed_at":"2026-08-07T18:23:10.070297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.050867Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"4c61c30f-b510-4fbd-88b5-c8db58adad89","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.510490Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:d7dfc6e621157c1448eda1413370d6fcc9c01e7bf715570c11fd5def1f35f0e6","observation_id":"ec3db6c5-8618-41dd-a0e0-fc2975811352","resolution":{"observed_at":"2026-08-07T18:23:10.056029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.037051Z","title":"Loongserve: Efficiently serving long-context large lan- guage models with elastic sequence parallelism","venue":null,"work_id":"7215be30-fd00-43d7-8218-d64eb9f05a4d","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.514615Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:2267117301e212326226e3ff0ce589c6e117706f16db6f341d1c40aa6f3aa163","observation_id":"ce5ad13f-c44f-4996-b5d5-3d1c1068e11c","resolution":{"observed_at":"2026-08-07T18:23:10.041553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-09T14:08:47.340904Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-07T18:23:08.520249Z","title":"Fast dis- tributed inference serving for large language models.arXiv preprint arXiv:2305.05920, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.520249Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:b91097a34f12c539df00cc813936b391f0a3676e5805b44081913b4312da3f51","observation_id":"321a3a82-8a7f-431a-b288-9d475621f8dd","resolution":{"observed_at":"2026-08-07T18:23:08.520249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.024111Z","title":"Orca: A distributed serving system for {Transformer-Based}generative models","venue":null,"work_id":"b82eec44-59c9-4125-9fbc-ca1ea7dc2fb9","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.524500Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:5ea1afd13ccbf0b88626ed19ebd99ff0ac49310a08f3d795e7a4bb0b6ecd3b87","observation_id":"d44d2940-594a-4da8-9e92-b240f4b8893d","resolution":{"observed_at":"2026-08-07T18:23:10.028543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:10.011122Z","title":"Taming{Throughput-Latency} tradeoff in{LLM} inference with {Sarathi-Serve}","venue":null,"work_id":"1a09d5b8-a456-43b3-a32c-e8bfb28cd394","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.528420Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:88052bd21eaacff3db6794bbdc81f4b65e967eba50f4ad75f2c4bc395e29e40d","observation_id":"e5b698e6-323f-4355-87d5-cc3ac62d84e0","resolution":{"observed_at":"2026-08-07T18:23:10.016099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.995004Z","title":"{InfiniGen}: Efficient generative inference of large language mod- els with dynamic{KV}cache management","venue":null,"work_id":"3a779fa4-96f8-4d04-bb3e-d92cbd83f5ae","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.532162Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e116aa9076f4709292b4d1d12b87bbb70ea287c17dbab9ce210779fd43b3016d","observation_id":"a47f28ee-3dff-4fe0-b73d-64c8f230a1b1","resolution":{"observed_at":"2026-08-07T18:23:09.999320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.981002Z","title":"Jenga: Effective memory management for serving llm with heterogeneity","venue":null,"work_id":"fca32d01-1263-4096-badf-61a2c4a515f4","year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.535995Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:5e895ef60eb9f2a339457730422fa570df9c1040ba996dea5b4e2f1405dc54d8","observation_id":"d7f6d99a-bfde-4c43-b0d1-93c0571d3a74","resolution":{"observed_at":"2026-08-07T18:23:09.985186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T18:23:08.539810Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.539810Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:f6502bc775ef6a11e84d37ed2a4993db5100a02ea608ce6ea5da2c83a03a4f95","observation_id":"47d81dd6-1a6f-458a-91d8-0c0eb459dba6","resolution":{"observed_at":"2026-08-07T18:23:08.539810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:08.544105Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of machine learning and systems, 6:87–100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.544105Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:acbf6c3495d7de7645a0d90e21586505fddfb7351815d45508ce35af8b094444","observation_id":"1ec8b77c-2dc6-4430-a65d-ae0ace596689","resolution":{"observed_at":"2026-08-07T18:23:08.544105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.961007Z","title":"Flashattention: Fast and memory-efficient exact attention with io- awareness.Advances in neural information processing systems, 35:16344–16359, 2022","venue":null,"work_id":"1a3ebf89-9e6d-4dad-a0c3-dcd78e57c1a3","year":2022},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.547722Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e6207b2e16eecef8a9039f3ccd6dc734259858861ff8f068aaa5287a2bdd7bde","observation_id":"e727258c-6057-4d0d-b6fc-f4007d5afa6c","resolution":{"observed_at":"2026-08-07T18:23:09.965148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-07T18:23:08.551553Z","title":"Flashinfer: Efficient and customizable attention engine for llm inference serving.arXiv preprint arXiv:2501.01005, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.551553Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:2df112478fabc98ee4a4e1ad4e17b904996e0ef219e8566e935c9856ca291580","observation_id":"84c4db5f-97ed-4335-a15a-5f09fc966fd5","resolution":{"observed_at":"2026-08-07T18:23:08.551553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.948339Z","title":"https://gith ub.com/langchain-ai/langchain","venue":null,"work_id":"075c13cc-de6b-49e2-911d-cf7a6b20c97a","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.555354Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:a313cd660d700b2a4e889b8f4a9ba84580fa89bad2d881ac915247c4d7aa6a41","observation_id":"097379e1-7500-43d0-8074-29ede2225e43","resolution":{"observed_at":"2026-08-07T18:23:09.953397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.936219Z","title":"https://www.langflow.org/","venue":null,"work_id":"4fc65de1-0445-4d2e-b292-4a9e6cba6589","year":2026},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.558727Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:1711d6a00dc364357c520233afa3f944d4c6a3323e005f9c85ff1be9684f462f","observation_id":"da08e753-aeb8-4041-b346-72bca9005c74","resolution":{"observed_at":"2026-08-07T18:23:09.940054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-07T18:23:08.562330Z","title":"Auto- gen: Enabling next-gen llm applications via multi-agent conversation framework.arXiv preprint arXiv:2308.08155, 3(4), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.562330Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:68dbe3653ecba9a93395b59826e1e6278d978d147ce8ccc1d5f1de386fb3d39a","observation_id":"829b080f-c9c2-465c-af2a-a92e10744480","resolution":{"observed_at":"2026-08-07T18:23:08.562330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:09.924232Z","title":"Dspy: Compiling declarative 17 language model calls into state-of-the-art pipelines","venue":null,"work_id":"1823220b-a3ba-45e6-a33b-0af4732ee1ae","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.566354Z"},"links":{"citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:63c5513b9edb62d87a2cb5ba190ed30aabf7ab567a031492abf01571bfead6fb","observation_id":"a982b658-0abc-40b2-bc57-01279d88e8c3","resolution":{"observed_at":"2026-08-07T18:23:09.928405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12488","last_updated":"2024-12-17T02:44:43Z","snapshot_observed_at":"2026-07-06T20:08:16.471575Z","submitted_at":"2024-12-17T02:44:43Z","title":"A System for Microserving of LLMs","version":1},"cited_work":{"arxiv_id":"2412.12488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.12488","snapshot_observed_at":"2026-08-07T18:23:08.603497Z","title":"A System for Microserving of LLMs","venue":"cs.DC","work_id":"38fb0145-240f-4042-a9ef-97a1366f6f16","year":2024},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.569863Z"},"links":{"cited_paper":"/paper/2412.12488","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:8e9aaea18a3f772ecb702b8b431dff5f35fa951919a101be2548c0afb1475cc0","observation_id":"d6368581-12ab-416e-8120-5c3d69cb5437","resolution":{"observed_at":"2026-08-07T18:23:08.608861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T23:12:43.717195Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":51},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2608.06007."}