{"as_of":"2026-08-05T14:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:819489b79182e7305e2bcbd0a3bf50301ef04225e2d25d1c81121fcb5b86c3a2","coverage":[{"denominator":151,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T06:27:23.580445Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T21:14:49.980623Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17227","snapshot_observed_at":"2026-07-11T21:14:49.980623Z","title":"arXiv preprint arXiv:2604.17227 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04164","last_updated":"2026-07-05T08:08:26Z","snapshot_observed_at":"2026-08-02T13:49:45.199051Z","submitted_at":"2026-07-05T08:08:26Z","title":"BrownoutMoE: Structure-Aware Expert Grouping for Efficient and Accurate LLM Web-based Services","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T21:14:49.980623Z"},"links":{"cited_paper":"/paper/2604.17227","citing_paper":"/paper/2607.04164"},"observation_digest":"sha256:24fdd08cc70434e43a2b35bdab57e0a46672a79442f23078450e4ceabe3118a9","observation_id":"4804a744-832c-4fc8-acef-932896006489","resolution":{"observed_at":"2026-07-11T21:14:49.980623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17227","snapshot_observed_at":"2026-07-11T21:08:24.159706Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04181","last_updated":"2026-07-05T08:52:41Z","snapshot_observed_at":"2026-07-11T21:08:22.458239Z","submitted_at":"2026-07-05T08:52:41Z","title":"CoCoScale: Leveraging Layer-wise Scaling to Unlock the Potential of Online LLM Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T21:08:24.159706Z"},"links":{"cited_paper":"/paper/2604.17227","citing_paper":"/paper/2607.04181"},"observation_digest":"sha256:508edc50099e3fc404a6cbf2332a447d7322e3fd788007c6568b2bb04b91cdb5","observation_id":"ab4d15bd-1b8b-4b4a-8b7c-eedd876d3522","resolution":{"observed_at":"2026-07-11T21:08:24.159706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.17227/citation-record","integrity":"/paper/2604.17227/integrity","json":"/paper/2604.17227/citation-record.json","paper":"/paper/2604.17227"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 18th USENIX Symposium on Operating Systems Design and Implementation","venue":null,"work_id":"520a277c-b5cf-49e6-8070-57ccb4123015","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:548ab63f5942556d97a49d3bbf27e793248754b669507e083b28bc2032cf4212","observation_id":"c48d021b-c541-4a70-97a1-acbdd17d45ab","resolution":{"observed_at":"2026-05-21T16:34:17.366677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cloud container technologies: a state-of-the-art review.IEEE Transactions on Cloud Computing.2017;7(3):677–692","venue":null,"work_id":"7bc8886f-d490-4d5d-a1da-97278f51a2e5","year":2017},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:e1fef1cd20e2fd6cd2036ab6b481141a16e4f493b5758af3bf3cbca64fc85cbe","observation_id":"cb4b2a59-1731-492c-8188-b74ba53c7337","resolution":{"observed_at":"2026-05-21T16:34:17.338435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"817fce90-fae6-468f-a4ff-90e6b88ea61e","year":2017},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:730aabc8a4311300a5667180b7ad325ef535a0c3e422ba80cf49b5f0bb5d03aa","observation_id":"87d57ad5-9bb0-4aa3-b1f4-e7e99f4f2c17","resolution":{"observed_at":"2026-05-21T16:34:17.326453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:2a382805ba1a19daff5686d9ccc484dbfabbf6d7c1576cee0e6915034a142b3b","observation_id":"cfbd3ce2-6896-4075-b0a1-30ca5b82bf50","resolution":{"observed_at":"2026-05-10T06:31:30.880784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning.Nature.2015;521(7553):436–444","venue":null,"work_id":"521a002f-6827-42c8-a39b-598c76efc7e0","year":2015},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:cd2fad6033b2c0993184dcae5a6e454c8ccea75d240042b6dee00625f1898b38","observation_id":"921ccf4f-c350-484b-8d0b-9fc327f4461e","resolution":{"observed_at":"2026-05-21T16:34:17.340832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"303f29b0-4c59-4824-8abd-10d33ff52cd6","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:e21c7925b2e28b2f93aa44019fe71c905927bc39f893cfffb2e6dd32192af23d","observation_id":"42cc0610-3505-46a8-94f3-434d6cea221d","resolution":{"observed_at":"2026-05-21T16:34:17.362597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.; 2020","venue":null,"work_id":"9762c29b-9893-4af4-a8ad-f1a6651f6186","year":2020},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:81641657ecebfd8e41b6036d019719476062c49dfd680e27a8c997154dcc29c8","observation_id":"a4c780b8-a6aa-4ea1-9cde-96d2911ed3d5","resolution":{"observed_at":"2026-05-21T16:34:17.285487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curran Associates, Inc","venue":null,"work_id":"0186e76f-de70-42bb-bce0-a8510c975d59","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:63d22906217eb5437f544cc7d0312156c8f9f06c3b93129e346df4c92914557b","observation_id":"e4414f9a-de00-4c4a-8ab8-d5105e610d3c","resolution":{"observed_at":"2026-05-21T16:34:17.275458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"45f63ee2-62d7-4572-92dd-e86d0e548e55","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:aa13a1cf7f148baa5c8dbd1846f8d2d90a1bcae5dca26579d35867447dc1d3c0","observation_id":"edd5c27a-92dd-4792-8e0c-2ec5752cc93f","resolution":{"observed_at":"2026-05-21T16:34:17.316645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":null,"work_id":"bf655896-f3c5-4b0a-8d34-63ea5ebb6eb5","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:285dcc1c2307700e0c635d2e481a496448554d9f75f7959962c1548c52ad1729","observation_id":"7d1ee9dd-94c6-4734-a7a8-0f3a543aff82","resolution":{"observed_at":"2026-05-21T16:34:17.360767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards end-to-end optimization of llm-based applications with ayo","venue":null,"work_id":"0c9036fd-f59a-46e9-a31c-618e598fa902","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:b31853b63b804d83a837d186f8dfeb06a0367bf720e4f448484c39038c239be5","observation_id":"abbd93f5-bdde-4ef1-86ff-452886a8afc1","resolution":{"observed_at":"2026-05-21T16:34:17.356085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In-datacenter performance analysis of a tensor processing unit","venue":null,"work_id":"eb558bfa-8fd1-4c6e-86af-692ea45c2bf8","year":2017},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:e6db83ea1a2934df7f7854abf39077536aa4a8df87293f8696280c47dbbababd","observation_id":"191292db-c5f5-46bb-a001-ca180fef44a1","resolution":{"observed_at":"2026-05-21T16:34:17.322518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpa: Automating Inter-and Intra-Operator Parallelism for Distributed Deep Learning","venue":null,"work_id":"6142d1df-2870-4513-badd-a0da30ee7911","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:ab3772d0f4405db65626242440a5f9772c9a8e081964d228d665b2d97fadaf3f","observation_id":"71e6585a-b4c3-484f-8bc6-464319c0caf5","resolution":{"observed_at":"2026-05-21T16:34:17.259827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"4c6ddbb0-d9dc-4726-9b65-ca652b4022fe","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:9d1050c4cf20ac1a57e49d1dfa7ada30399891b39dcd3f0e83aeef09494d838a","observation_id":"76f87055-c3fd-41ea-8f8c-b79c8a5a175f","resolution":{"observed_at":"2026-05-21T16:34:17.328335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open issues in scheduling microservices in the cloud.IEEE Cloud Computing.2016;3(5):81–88","venue":null,"work_id":"e6c62917-a606-43d0-98e4-e5f6acbbe4e2","year":2016},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:d60107110035bdac5d9e9be1f9e25c015c9bebc80b3f2ea4433972daf5b81a53","observation_id":"00b1b090-037b-4b7b-a68e-63993c042d0b","resolution":{"observed_at":"2026-05-21T16:34:17.330406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be3eb289-aceb-4020-a94d-8074f89a9fa3","year":2026},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:5340d331f69440d6f45351afcf9ddd04c358a49d5024616dc5e669bc4faf7080","observation_id":"c6832a14-856f-4a83-8538-6dd4db7e69ee","resolution":{"observed_at":"2026-05-21T16:34:17.344166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"dbafd38c-1e04-425b-b7fb-30135e384a60","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:10b52d33b4602029d4bc03b46d693145451ccb672d5311fd02d5d6ce1e4ac398","observation_id":"04b02cac-0fc8-495f-88f3-a0b7207abf99","resolution":{"observed_at":"2026-05-21T16:35:22.390830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 16th USENIX symposium on operating systems design and implementation","venue":null,"work_id":"269ca3b0-be85-4ed5-b367-d310f4438c92","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:f8823dd6a0d2d35b39ad0ceb0681d66e27fe8949f759706c56f1ce8321dc536c","observation_id":"31c66a56-e34f-4b51-9dca-7a324c2a4559","resolution":{"observed_at":"2026-05-21T16:34:17.312290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluation and benchmarking of llm agents: A survey","venue":null,"work_id":"cf7734d3-17f8-4094-8960-c3a08e6ede2b","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:9054a9437295639469de335272f5ef5c2efec73f4d164c7a69c23835aa194c90","observation_id":"7592b4d9-ee42-4e58-99f8-b94283ad7729","resolution":{"observed_at":"2026-05-21T16:34:17.380668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards High-Goodput LLM Serving with Prefill-decode Multiplexing","venue":null,"work_id":"7b85ab11-17ae-41a9-a1d3-61b104b90bad","year":2026},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:0d1a8cf499954929dd7d1c9276a77457ba6318ce9525967d36fbdbd8bfaaba4a","observation_id":"f62d3047-60a2-4612-a197-c53594eb37af","resolution":{"observed_at":"2026-05-21T16:34:17.300201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Watson: A Cognitive Observability Framework for the Reasoning of LLM-Powered Agents","venue":null,"work_id":"abc7ecb9-6747-4175-9541-2edac9cdb20d","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:da8d41f063d962df9897820937cb828a82b0862901431cfcbc91343acac70f6f","observation_id":"d0dcb709-9ef9-4b4f-8ceb-a3b11b8cbe72","resolution":{"observed_at":"2026-05-21T16:34:17.302362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Process modeling in web applications.ACM Transactions on Software Engineering and Methodology.2006;15(4):360–409","venue":null,"work_id":"bae96a6d-5cea-4150-9d77-f162014e0673","year":2006},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:590e3b76a20769ee089ce6f328ec07667ef9a64d9dc82852f06937c7752829f9","observation_id":"7de80109-f300-4869-8291-f4851a0591e6","resolution":{"observed_at":"2026-05-21T16:34:17.310408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenges in deployment and configuration management in cyber physical system","venue":null,"work_id":"2d3eb5c8-2a3e-4027-983a-3b9a9e0dbb79","year":2020},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:0293c11a1106b79aa98aceafecbcda22c321d7403844176e3584eb448ed8e806","observation_id":"674efc27-9095-43ba-8783-20e44dd606c0","resolution":{"observed_at":"2026-05-21T16:34:17.296029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallel processing systems for big data: a survey","venue":null,"work_id":"82edf789-7a3a-4f5b-a3b5-ba7cb88411b5","year":2016},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:37d65949d5dc33cad1eb845493f77cda2193b81bd1286c5a1d0b7b4d574d01bd","observation_id":"3e8760e8-7ba6-4e9a-989d-1cdc00472b7d","resolution":{"observed_at":"2026-05-21T16:34:17.384760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"352fd0dc-58ca-4a1d-a6d1-e97f9b21dbbb","year":2020},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:d9f5ee834b55f1fa6d249df05cfddff4a7bbf919affa31ed649bd68c4d589fee","observation_id":"87b97a7f-290d-432b-9472-6b79a89b36a8","resolution":{"observed_at":"2026-05-21T16:34:17.308428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning workload scheduling in gpu datacenters: A survey.ACM Computing Surveys","venue":null,"work_id":"93a61715-766f-4944-a62e-fb6725773612","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:4135ea855264acef2638ca9ffce6bdf054b92344f5580753cd60d9e5c0566531","observation_id":"3266407b-5c1d-4cd9-a523-4b9831d03494","resolution":{"observed_at":"2026-05-21T16:34:17.304441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3686253","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"StatuScale: Status-aware and Elastic Scaling Strategy for Microservice Applications.ACM Trans","venue":"ACM Transactions on Autonomous and Adaptive Systems","work_id":"3e576193-35a5-43e9-b0ee-c37a71015c7b","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:c53feb5c5561ebd05562a7d92367f294206bd2021938ca477b52e347d6469cd3","observation_id":"c5b06068-db71-42aa-a74e-63855aa317e8","resolution":{"observed_at":"2026-05-10T06:31:30.372822Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs.Authorea Preprints.2025","venue":null,"work_id":"b0b79b55-5607-48f1-92f5-e6a1e880c38d","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:49aa801078aa1596e176936f45d183e1063a54a7d31c6efd1c72756c2c6843af","observation_id":"aee1276b-26da-4cb1-9be2-40515646f7fe","resolution":{"observed_at":"2026-05-21T16:34:17.291688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18007","last_updated":"2025-07-24T00:49:56Z","snapshot_observed_at":"2026-08-04T04:33:28.044411Z","submitted_at":"2025-07-24T00:49:56Z","title":"Cloud Native System for LLM Inference Serving","version":1},"cited_work":{"arxiv_id":"2507.18007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18007","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cloud native system for llm inference serving","venue":null,"work_id":"f254d85c-7618-41ee-8fa0-8c297ba9b0ce","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2507.18007","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:98a5b7e7b03285ba36403ae0729b0b4bcde6932c164cc29463da33897f6c6168","observation_id":"9ed6541f-855a-4c8a-ad05-0de53dbfd62c","resolution":{"observed_at":"2026-05-10T06:31:30.777592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{NanoFlow}:Towardsoptimallargelanguagemodelservingthroughput.In:Proceedingsof the 19th USENIX Symposium on Operating Systems Design and Implementation","venue":null,"work_id":"ada31c96-8b1c-459e-b8a3-058d4550a699","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:fea34d93622e1a7701439d53682ba39b38f1efe37d1308d06bfd7e30ab4fc206","observation_id":"c6219f06-6e3a-45c4-bb18-ba43623f8455","resolution":{"observed_at":"2026-05-21T16:34:17.318701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashinfer: Efficient and customizable attention engine for llm inference serving.Proceedings of Machine Learning and Systems.2025;7","venue":null,"work_id":"53d2bf39-bfb1-4be5-ad3b-6cb58b04eca0","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:f23a146e36563dd537d76b5b8aa65a3d6f8bfde2ee75b89f874d9d3814c109dd","observation_id":"8a1a0b92-22c1-45d6-9c25-9a4134562f43","resolution":{"observed_at":"2026-05-21T16:34:17.279709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025:446–461","venue":null,"work_id":"9e332902-3ab1-4b90-a7b8-a62ff48937f9","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:a848230be022d3bad728c09c5f30522be907c20af0f9322f62ae36c931b97489","observation_id":"b70ee6af-dddb-4229-9208-ca4bc3086d6c","resolution":{"observed_at":"2026-05-21T16:34:17.283410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"throttll’em: Predictive gpu throttling for energy effi- cient llm inference serving","venue":null,"work_id":"f3016280-e06a-4dc1-b3ce-9f40c5f6807b","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:a810738d6b49f862367e824a7f89589075735069e90206398cc91bb7db518b15","observation_id":"a32948a6-e47b-4542-8725-c4ae40f46be8","resolution":{"observed_at":"2026-05-21T16:34:17.350080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16731","last_updated":"2025-07-22T16:13:43Z","snapshot_observed_at":"2026-07-06T22:01:07.517110Z","submitted_at":"2025-07-22T16:13:43Z","title":"Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges","version":1},"cited_work":{"arxiv_id":"2507.16731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16731","snapshot_observed_at":"2026-06-29T21:53:59.101198Z","title":"Collaborative inference and learning between edge slms and cloud llms: A survey of algorithms, execution, and open challenges","venue":null,"work_id":"69b873ac-d384-48eb-b914-8f576f056514","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2507.16731","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:e14e8b8739013a529bd2004d5f7b531160150ba236d42766840d72efb6d3cf27","observation_id":"136e5946-975c-43d6-948e-22a5ef67db2d","resolution":{"observed_at":"2026-05-10T06:31:30.807812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extracting training data from large language models","venue":null,"work_id":"a253eee3-ffb1-4cc9-bbd4-b61bb13c5f16","year":2021},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:583ec0f6aad36934ec2995c426a1a752494722bcfb8e336b7e3c42149ffcd694","observation_id":"3f61e7be-90b1-4fc5-a2e0-3b76f985d0dc","resolution":{"observed_at":"2026-05-21T16:34:17.324489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantifying memorization across neural language models","venue":null,"work_id":"4fa111b6-f6d9-40d9-bd22-e79753b9d1ff","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:1d055b5ab2f68b99a714e0139981f136024b96e351ed28eda9972b7c6812e28d","observation_id":"52b95004-ad1a-4f20-b241-b1c70af874c5","resolution":{"observed_at":"2026-05-21T16:34:17.346215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning with differential privacy","venue":null,"work_id":"1675e50c-6c2c-467a-ae37-3c069db408fb","year":2016},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:1922c6179bb5ad9276501a510c192a718c763fa4543af0eca89abca5fba85517","observation_id":"0d4861b5-39cc-417a-9dce-1fd76660fbb7","resolution":{"observed_at":"2026-05-21T16:34:17.348168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Communication-efficient learning of deep networks from decentralized data","venue":null,"work_id":"05da3b3f-bacd-47b9-b06c-140381185d82","year":2017},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:bb200b73199b9759f4fc761e1278ce08e51ce87faf1ca7a6612a8197fb2e2abc","observation_id":"79988a33-79ae-4a19-802b-1b733f770298","resolution":{"observed_at":"2026-05-21T16:34:17.253289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oblivious {Multi-Party} machine learning on trusted processors","venue":null,"work_id":"1fd81537-84bc-44d0-87b8-5d1161dee398","year":2016},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:0c9a8a9d293e5e9c60b1327abb8f5d8f97871db4501810f0e234232cb447ca47","observation_id":"9fb2a544-f8fc-4640-8e94-99a86ad8a14a","resolution":{"observed_at":"2026-05-21T16:34:17.266586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not what you’ve signed up for: Compromising real- world llm-integrated applications with indirect prompt injection","venue":null,"work_id":"09000f57-3183-4002-8aa2-be021af424d5","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:7cac3363b218d777bf4dc7794fa37875c99e84355b529937d1675d16650ca956","observation_id":"84cbbcb9-0f0e-4a32-858f-d4609f09995c","resolution":{"observed_at":"2026-05-21T16:34:17.289684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stealing machine learning models via prediction APIs","venue":null,"work_id":"2e87578c-fda7-42be-a4bf-898840dce848","year":2016},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:a35684d90568f62cb2d5e25db3306520f4da93801711013a639b81befb916fb2","observation_id":"b7f52107-b027-4e1e-90c6-7726ee0fbdc8","resolution":{"observed_at":"2026-05-21T16:34:17.334407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:0f42a434ac501426f011e711803fe28fb7bc45d1fb2efd9ccab20f31eb107cca","observation_id":"3897ff2d-81d3-4c5b-a502-d1e187ecc349","resolution":{"observed_at":"2026-05-10T06:31:30.831485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACMComputingSurveys","venue":null,"work_id":"f845976f-2665-40aa-a12a-e096fc884854","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:191830b557e95f7ea2c1b9bdab8db5be313bb588bc12683d6a5960e2fce14005","observation_id":"867c3056-3558-43b0-9978-e4746d394dbf","resolution":{"observed_at":"2026-05-21T16:34:17.277744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEEInternet of Things Journal.2022;9(11):8364–8386","venue":null,"work_id":"b65411af-7319-452a-8970-77456fdeb1a5","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:c76acb81d384294af68865b48f7bc3e8915f0b6dfa761ec054cd44fb95b8731a","observation_id":"483a2e16-488a-47b8-a178-8cebbb345a8d","resolution":{"observed_at":"2026-05-21T16:34:17.261925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial big data architecture: from data warehouses and data lakes to the Lakehouse.Journal of Parallel and Distributed Computing.2023;176:70–79","venue":null,"work_id":"e1df03dd-2dd3-4140-85bb-b60a0bdd8b44","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:3aa2e1f5bc573818c5944c78314575b70b9693babc38cbf7a4c59f95e93769c7","observation_id":"d42d3bd2-9270-46c3-acf1-06fc45c39d89","resolution":{"observed_at":"2026-05-21T16:34:17.306573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEETransactionsonKnowledgeand Data Engineering.2023;35(12):12571–12590","venue":null,"work_id":"ae0944a1-5851-4bad-8c71-8bd6d1f2121e","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:a24d0015a586046c99ac5c4d26200746cf843f3c74e9ee925ac25040810e2469","observation_id":"feaab007-1c53-4b10-aeed-098ea0d3f8c6","resolution":{"observed_at":"2026-05-21T16:34:16.861097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14924","last_updated":"2024-09-23T11:20:20Z","snapshot_observed_at":"2026-07-06T19:20:23.589464Z","submitted_at":"2024-09-23T11:20:20Z","title":"Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely","version":1},"cited_work":{"arxiv_id":"2409.14924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14924","snapshot_observed_at":"2026-06-29T07:33:13.582327Z","title":"arXiv preprint arXiv:2409.14924","venue":null,"work_id":"af0c891e-fdf9-4948-a505-02d93676427c","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2409.14924","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:e0d4e56bd39e28d93808a1fb09930733ca07dd4ace5955ee8f1dd8576b341ea8","observation_id":"90ed30bf-8d6e-483d-9703-f031ef266de1","resolution":{"observed_at":"2026-05-10T06:31:30.820771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational cxl-memory solution for accelerating memory-intensive applications.IEEE Computer Architecture Letters.2022;22(1):5–8","venue":null,"work_id":"1d96c08a-369b-46c4-9d1e-88731c391650","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:37b6654dbbefe01df698807d97ec6eb2f4c838b80089422beb7606bb231b7431","observation_id":"56a3e7f3-5af7-45b2-890e-e365d97dc068","resolution":{"observed_at":"2026-05-21T16:34:17.243986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"380f587d-606f-40fc-811d-40d1b99d3375","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:7c8b089cc76f632e19af84beda5fe643759e5689a714974e0597a435faa7daff","observation_id":"39e63fcf-045e-4efd-83d7-d7d1c1292230","resolution":{"observed_at":"2026-05-21T16:34:17.298169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2312.10997","doi":"10.1186/1476-072x-8-72","metadata_source":"pith","pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","venue":"cs.CL","work_id":"b80d2790-6cd9-4c87-b3c4-de404f99a80e","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:eaa3d91480e4a20a68d3f09b8413c20de6e3836065553b82187ef965665d4813","observation_id":"a28dbc49-7171-4db8-b8d2-9f37d0ef3ead","resolution":{"observed_at":"2026-05-10T06:31:30.817937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"New Trends in High-D Vector Similarity Search: AI-driven, Progressive, and Distributed","venue":null,"work_id":"fe6fa655-fc1d-4c03-843b-49e589904fb3","year":2021},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:685917d157ee4aba7afec6cca24e3e00564745683b5dc3749b443d764bd56b29","observation_id":"139a995e-2eeb-4bd5-859c-619552c03f31","resolution":{"observed_at":"2026-05-21T16:34:17.368750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unleash llms potential for sequential recommendation by coordinating dual dynamic index mechanism","venue":null,"work_id":"5e79f7a6-3e31-484d-9ee1-71670505b72a","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:d649fa892b534e6200c2ac5e72b237b38167d9e6957d2a383a9b82e4248ebd10","observation_id":"6f894ca1-b279-46c6-a7cd-50a60b4ee277","resolution":{"observed_at":"2026-05-21T16:34:17.358378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d90f290b-ca39-42c4-b8e5-43d763b2e59e","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:53c5cf18a5ab2d47186beb23201129ef5d54e292b115267cf335946f26a49cc3","observation_id":"5a4194cc-fc9f-4b09-be6f-094e7a7c59d4","resolution":{"observed_at":"2026-05-21T16:34:17.268661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17603","last_updated":"2025-03-22T01:17:56Z","snapshot_observed_at":"2026-08-03T21:42:06.708316Z","submitted_at":"2025-03-22T01:17:56Z","title":"A Generative Caching System for Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.17603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17603","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A generative caching system for large language models.arXiv preprint arXiv:2503.17603.2025","venue":null,"work_id":"e5a74248-85f3-4e05-a2bd-a98afcc59830","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2503.17603","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:49e75efbb76201669627c7ed8b959e8887e6d702caf1e1e398e89e04809560b6","observation_id":"1ddf85f7-28e1-48f3-baad-46b027d7885f","resolution":{"observed_at":"2026-05-10T06:31:30.823360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.14311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:43:55.095406Z","title":"Tracing the Data Trail: A Survey of Data Provenance, Transparency and Traceability in LLMs","venue":null,"work_id":"ba661eed-deab-4a42-8021-0a273b41cbbe","year":2026},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:6b1f8ad3589ad9af77a91f19ac666f94da85f8ed77c49ac64d7c2d4d525ea803","observation_id":"e54daba5-3418-4a40-b476-013c1f153ae3","resolution":{"observed_at":"2026-05-10T06:31:30.834032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 41st IEEE/ACM International Conference on Computer-Aided Design","venue":null,"work_id":"5d5ab0c1-36a8-4690-bc61-c0bf07d65471","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:dc26dee26e06cbf7a1c2f2012485607023bd4101c5648146e85120b5d4dfd3bf","observation_id":"95e1ea6d-628d-4f72-81cb-e5e5314f365b","resolution":{"observed_at":"2026-05-21T16:34:17.314502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023:189–201","venue":null,"work_id":"1bc55b6b-5b91-4c8e-822a-23c8f6d2a7a1","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:0dd7ef9dedc8d33c13b030ed920b9e8f8db09de5fdac2669d6e3cad677d72c29","observation_id":"5a6e6b58-1395-41da-809e-8aa2ee6b3b5a","resolution":{"observed_at":"2026-05-21T16:34:16.950777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Packt Publishing Ltd","venue":null,"work_id":"f23dfcee-9a05-43da-830f-33fd907ca6ca","year":2022},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:63c663bdb2655f55769576353bea2e7d19acd166e21f59d75452d4a1d48f0370","observation_id":"cda81a75-03f0-4941-9fff-fc5a3bcba3a8","resolution":{"observed_at":"2026-05-21T16:34:16.844474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-pilot: Characterize and optimize performance of your llm inference services","venue":null,"work_id":"96686e1d-e7de-49e4-828f-56ea22c3dbf2","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:8e7f017dc09f0983dfe162c6d0fdec842a5706e9bc8ab0b11c69423898837efc","observation_id":"5acdf7b7-5833-4142-93cd-19bb6cea4ad3","resolution":{"observed_at":"2026-05-21T16:34:17.364636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09598","doi":"10.48550/arxiv.2505.09598","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How hungry is ai? benchmarking energy, water, and carbon footprint of llm inference","venue":"ArXiv.org","work_id":"885f8f83-1853-4126-98ce-0ed399630319","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:da9c6f7da466878ca3a5989c3652e1affc405bfcf8500d563390d2808bdd4cf0","observation_id":"4c10931d-66ce-424e-9566-8d6835130bad","resolution":{"observed_at":"2026-05-10T06:31:30.849607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T08:23:22.301305+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T08:23:22.301305+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.12016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on federated fine-tuning of large language models","venue":null,"work_id":"0c7b3157-a753-4668-b46a-3859ec22c7b4","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:42e1bb5af03bd6dfd943f4bb287785514e35af2dfc5255165d85d56c72ca485a","observation_id":"a560c185-448e-4cc3-bbb9-8a339d009fe9","resolution":{"observed_at":"2026-05-10T06:31:30.873235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.365501","doi":"10.1109/tc.2026.3655019","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Transactions on Computers.2026;75(4):1636-1649","venue":"IEEE Transactions on Computers","work_id":"d69332b2-7239-4623-8bee-643d9b90711d","year":2026},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:9130c7245baf53b160dd4734a84d79f4fb34b557c3505a37939ceb8c90fb9c9e","observation_id":"d9bde166-b12b-4be7-b4bb-c6e04bb594d3","resolution":{"observed_at":"2026-05-10T06:31:30.363657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.367001","doi":"10.1109/access.2026.3670018","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2026 , issn =","venue":"IEEE Access","work_id":"8430fa32-af4e-428d-88fe-880ebb413394","year":2026},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:799ce030a69e18dc6d3b2dee44bc74e7872610c04a9ac491149bd1c649e179bb","observation_id":"470a91df-ce65-4816-aec1-95220eeb9386","resolution":{"observed_at":"2026-05-10T06:31:30.366337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:24:03.526417+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:24:03.526417+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ShuffleInfer: Disaggregate LLM inference for mixed downstream workloads.ACM Transactions on Architecture and Code Optimization.2025;22(2):1–24","venue":null,"work_id":"d973df8d-2f4e-46c3-9d83-569189ff10fa","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:a4db249f1334ee9fbb1c81573b4bc21034741faa5a332c68f69c361b9dfbfd01","observation_id":"4cdca6a3-738d-4eb3-b33a-e108ece95454","resolution":{"observed_at":"2026-05-21T16:35:22.378027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","venue":null,"work_id":"2f01ade5-8437-4e6c-b1f4-da4c0d12397b","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:de4ecb163e41cb1365f73600fa49b0b1b9052ea3ce59cc7de695d1670a1c8de7","observation_id":"4b8d8b10-2c56-495d-b1c0-603b5941ac09","resolution":{"observed_at":"2026-05-21T16:34:17.374709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-07-06T15:25:24.491136Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.05920","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-07-04T08:39:41.965931Z","title":"Fast Distributed Inference Serving for Large Language Models","venue":"cs.LG","work_id":"30a55970-0187-4540-943d-f310a5414413","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:d2c2d9395b1e2798eafc9213ab4edbfb3adeb4026628233739a09a1a00856ce3","observation_id":"c02a5c08-c33e-4da5-b4cf-530662a421fc","resolution":{"observed_at":"2026-05-17T11:23:46.844514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-07-06T22:19:14.155788Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"cited_work":{"arxiv_id":"2508.19559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19559","snapshot_observed_at":"2026-07-04T02:39:25.590182Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference.arXiv preprint arXiv:2508.19559.2025","venue":null,"work_id":"363b745c-6b1b-4dbf-9be7-79cbb2b32379","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2508.19559","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:18d20315b9c4d00a436124c39a9c58906f36cab8216566cdd121298ec22c431c","observation_id":"cf870d12-d482-4314-8454-4d57614fcc5a","resolution":{"observed_at":"2026-05-10T06:31:30.854890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03416","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TokenScale: Timely and Accurate Autoscaling for Disaggregated LLM Serving with Token Velocity.arXiv preprint arXiv:2512.03416.2025","venue":null,"work_id":"2c237586-ef81-4438-bcbb-0ab45a2a66d7","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:b6ac1bb3109542010b9d83f44b3a6e104b847495675a75d987d55e8656aaed2b","observation_id":"1e2d305a-eb41-4beb-b51b-bc43a6fd9001","resolution":{"observed_at":"2026-05-10T06:31:30.847190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoongServe: Efficiently serving long-context large language models with elastic sequence parallelism","venue":null,"work_id":"4043a8f0-6b5f-4817-8bbb-b12ebc5d74e7","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:717d921e045a58b58b6e99c66b3f0480dee2ff6e26368285989de3caecc3aaa8","observation_id":"0ebbb320-0c7b-4aa0-9864-c55af95745a8","resolution":{"observed_at":"2026-05-21T16:34:16.958636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dLoRA: Dynamically orchestrating requests and adapters for LoRA LLM serving","venue":null,"work_id":"808cbb5e-268d-4e2b-902c-4347f3a81356","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:257fb393506e84125de82db61aef1de98a8e77c0b8212608cba52097f539bb41","observation_id":"6c720b1a-abd1-4dfe-bb2a-3d0af8021e15","resolution":{"observed_at":"2026-05-21T16:34:16.956536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MegaScale-Infer: Efficient mixture-of-experts model serving with disaggregated expert parallelism","venue":null,"work_id":"108dd848-f1b9-495f-b9f3-3e41a879e3ef","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:a49f76c73b5f385673edb7e0e0b88e924ed459de4963597a58b2cf017233ad56","observation_id":"07cb87e2-5ea5-4db6-9d49-76b258da44c6","resolution":{"observed_at":"2026-05-21T16:34:16.831402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Punica: Multi-tenant LoRA serving.Proceedings of Machine Learning and Systems.2024;6:1–13","venue":null,"work_id":"a8ff8992-e383-4a6b-90fc-0d0819406273","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:add711a55435802cd9bd0e45b9e5a1662e2365713101fa486b64c2ea3777b892","observation_id":"e6f1961f-65db-4611-baea-e25520c1d722","resolution":{"observed_at":"2026-05-21T16:34:16.970694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AlpaServe: Statistical multiplexing with model parallelism for deep learning serving","venue":null,"work_id":"7d0839c3-730c-4ad8-8d77-0d6b85a4b188","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:d48051fc0afde646b88b3bd5d668d8fbaf8eeefc0809281fae9589735b6b88b2","observation_id":"252ce8d0-2450-4d20-ab5a-a1d0bc76e187","resolution":{"observed_at":"2026-05-21T16:34:16.823625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22562","last_updated":"2025-03-28T16:04:20Z","snapshot_observed_at":"2026-07-06T21:00:22.643921Z","submitted_at":"2025-03-28T16:04:20Z","title":"Niyama : Breaking the Silos of LLM Inference Serving","version":1},"cited_work":{"arxiv_id":"2503.22562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.22562","snapshot_observed_at":"2026-07-03T20:58:57.829370Z","title":"arXivpreprint arXiv:2503.22562.2025","venue":null,"work_id":"58db7a08-a98f-462d-a25b-4970d28ce9a8","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2503.22562","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:b1190ad228563ecf7df9de8ee148d9013c2effcdd3986d0d3e998e0d6665b526","observation_id":"89e93491-6fd0-4de9-9676-507bdd68670d","resolution":{"observed_at":"2026-05-10T06:31:30.826535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/spe.70054","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Dis- aggregated LLM Serving in AI Infrastructure","venue":"Software Practice and Experience","work_id":"8598759a-90cc-4fd0-8f4e-a48427de5cde","year":2026},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:786e7685ccbb32b2e5e734588fcc47e4594e8ff503944a9bae86a9a71f051c9a","observation_id":"b768dfc0-cc88-4817-ac1e-a89250b66ff3","resolution":{"observed_at":"2026-05-10T06:31:30.371034Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DynamoLLM: Designing LLM Inference Clusters for Perfor- manceandEnergyEfficiency.In:Proceedingsofthe2025IEEEInternationalSymposiumonHighPerformanceComputer Architecture","venue":null,"work_id":"01178669-ab33-4a2b-ab13-4d2519fa9967","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:794b7296178a797a94274b503901d88c0b0856beab6d1719f83eb0c54af17d32","observation_id":"d9e69d42-00ab-4fce-92f1-1ebd1daf33cd","resolution":{"observed_at":"2026-05-21T16:34:17.372914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024:207–222","venue":null,"work_id":"9f087c67-984f-4bc7-8f53-149b15cc7d44","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:2bc55b36815c8b4589a8029dfc0d2467f514c6b01347ed5315696d1a1bc0c142","observation_id":"b769b3bd-5ab1-4d73-b565-4ea4b0e547f8","resolution":{"observed_at":"2026-05-21T16:34:16.833945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2","venue":null,"work_id":"7fefb7be-4a22-419d-885f-2329b3d653a7","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:f6dbb594862be686c4b5f07c0a28c1168a4be5f376fb46f47cba7d52eb12ce7c","observation_id":"34368300-537d-4d58-9c1d-09b685e1df89","resolution":{"observed_at":"2026-05-21T16:34:16.854056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12162","last_updated":"2025-05-17T07:09:10Z","snapshot_observed_at":"2026-07-06T20:23:53.794006Z","submitted_at":"2025-01-21T14:15:01Z","title":"AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2501.12162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12162","snapshot_observed_at":"2026-06-30T00:24:04.305830Z","title":"Adaserve: Accelerating multi-slo llm serving with slo-customized speculative decoding.arXiv preprint arXiv:2501.12162","venue":null,"work_id":"29bbd187-e529-40c4-bb30-608f5bee82b7","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2501.12162","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:b41cda573a12d89988fa2da0772c1e7279b8aa19aa67505e6461f98f74c47432","observation_id":"7e021acf-ec94-43f0-ad98-bddc56040aaa","resolution":{"observed_at":"2026-05-10T06:31:30.784210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fairness in serving large language models","venue":null,"work_id":"6b7e5484-7d53-41bd-8ca6-07239d029d1a","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:6367d8cbdce675f49b78f958e4d314c9a25d608d4e0678382a6906b5cbf6b3ce","observation_id":"48d79405-9708-478b-8961-ebd6a4bdf4a2","resolution":{"observed_at":"2026-05-21T16:34:16.889999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.343338","doi":"10.1109/tap.2024.3433389","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DRPC: Distributed Reinforcement Learning Approach for Scalable Resource Provisioning in Container-Based Clusters.IEEE Transactions on Services Computing.2024;17(6):3473-3484","venue":"IEEE Transactions on Antennas and Propagation","work_id":"056f3627-3c89-4aa3-83b9-840e14136a2e","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:8be2ae8a21cd8b3b460e85f0ce11bf3b7e999a008eb193bea43444eb2808c4a3","observation_id":"4db4c170-dc7f-4925-9d9c-198787d691ab","resolution":{"observed_at":"2026-05-10T06:31:30.369104Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 2023 USENIX Annual Technical Conference","venue":null,"work_id":"797c8a1b-41fd-4127-82cb-e0f2164f5a24","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:260d9ee4f372032e868b922195d6b3f436a666a969bbccc0943e217b7abeaf22","observation_id":"4f59ea1a-7706-4412-8db4-9cf016b23707","resolution":{"observed_at":"2026-05-21T16:34:16.980492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024:929–945","venue":null,"work_id":"bfdd7c4f-c145-46eb-8da1-8dd4acba1912","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:9f229b9b3f5f5e04f18ede539d351df4c6efe1dde2e32859d7ef5e2f8f146f73","observation_id":"0855d5e9-181c-4cf3-b976-b5aa139b186d","resolution":{"observed_at":"2026-05-21T16:35:22.386322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e31fe1eb-9c99-4b6c-9329-12a96dcb6710","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:df0699c5ed8f3c843a01cd2997ced50eaa41aa52744b1a845f657d2cc8d0616d","observation_id":"f6b3a9a2-364a-4b87-a085-8f8509fef4a1","resolution":{"observed_at":"2026-05-21T16:35:22.388478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis","venue":null,"work_id":"511ed7f2-25a6-49f5-a21f-ea4a8cf87cdb","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:fb94436320641e63c85a24f1177ddceeebdf9420a34e589653395b868069c80f","observation_id":"80a2d610-850d-461a-b19e-f84086bd8d0a","resolution":{"observed_at":"2026-05-21T16:34:16.994671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"USENIX Association 2024; Santa Clara, CA:135–153","venue":null,"work_id":"f9cd4957-593d-4fad-8f42-be4943dc97f2","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:1aac30806eeaae10f3ce45446825b64722f012e2af94f408531bdace228ca796","observation_id":"fa266403-5627-4fff-a767-dca513225439","resolution":{"observed_at":"2026-05-21T16:34:16.997301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TAPAS: Thermal-and power-aware scheduling for LLM inference in cloud platforms","venue":null,"work_id":"4415e3db-9754-4ba1-b02d-027e7314dc4e","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:73740829bee12e0c0d2f80b11bceb787dfbc5c0c43872a5485151ce81955f88f","observation_id":"a1edc71a-d655-4c6e-a2bd-beff4a77fe74","resolution":{"observed_at":"2026-05-21T16:35:22.384097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"throttLL’eM: Predictive GPU Throttling for Energy Effi- cientLLMInferenceServing.In:Proceedingsofthe2025IEEEInternationalSymposiumonHighPerformanceComputer Architecture","venue":null,"work_id":"2eb4ff36-1161-4b0c-b8ab-ea8eadf710ea","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:b76c72ff6ee149aad0947f11e1920076e3309f1c775cd24d5f5f07ebe2474488","observation_id":"26b0ea8f-3cbd-4e8c-a4c6-80e7b21ac568","resolution":{"observed_at":"2026-05-21T16:35:22.381085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medusa: Accelerating Serverless LLM Inference with Materialization","venue":null,"work_id":"d4f57cc8-73f1-47ff-8fe0-6469c6a61ede","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:1edba523fa726364daf9789103567e070ae1c5186995dc00cf8ff97f88d7f93c","observation_id":"b59494f5-6e33-4c66-a087-a3e4edb67882","resolution":{"observed_at":"2026-05-21T16:34:16.828861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BlitzScale: Fast and Live Large Model Autoscaling with O (1) Host Caching","venue":null,"work_id":"c6834925-28dc-4640-9018-dec17f3316bb","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:48c70991caed7a8a588a3f9fdaadf44739c336f101b123ff38905e32c2115fdf","observation_id":"54a4aea7-0576-4baa-b0db-10a051ecd40c","resolution":{"observed_at":"2026-05-21T16:34:16.836715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025:415–430","venue":null,"work_id":"30eb882e-42a2-4e39-8421-5fa68cf2ac1d","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:ed8c42c867cc3e41d3cee301db7fb56b04295315821a8d6ed639a070b577907e","observation_id":"04ae0b47-ae62-40d0-b1e8-1a3e30cfa5e5","resolution":{"observed_at":"2026-05-21T16:34:16.952789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"32d606ae-4aa6-42bd-92ec-d9bc5fac9948","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:e60f6f7f7251bfa79a1e734f4948bd3f7c7f888876ba3d4d2c0f71f1d2d5e4e8","observation_id":"72bfd0a9-e6db-497c-a0ff-9edcd31fa148","resolution":{"observed_at":"2026-05-21T16:34:16.965952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FPGA-Based Sparse Matrix Multiplication Accelerators: From State-of-the-Art to Future Opportunities","venue":null,"work_id":"4afb297c-97fc-4d73-b9d2-92d9e3b44b5d","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:d60382b860b8357af56eac1f5f19ca361287995a74c9497339baffdc8ebc7305","observation_id":"0c6c0afc-6793-4665-89fe-b29eadc0bca2","resolution":{"observed_at":"2026-05-21T16:34:16.946047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on hardware accelerators for large language models.Applied Sciences.2025;15(2):586","venue":null,"work_id":"3fded203-d65a-407d-b0ff-8b79fe286e7f","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:990486a2c5b46353406c3c8bfbaa34875253b030315fed21766a4fc19f1c32cd","observation_id":"2a152618-5713-4a2f-8ee9-7e371ce6e873","resolution":{"observed_at":"2026-05-21T16:34:16.984399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08191","last_updated":"2023-07-17T01:39:38Z","snapshot_observed_at":"2026-07-06T15:54:35.654279Z","submitted_at":"2023-07-17T01:39:38Z","title":"Unleashing the Potential of LLMs for Quantum Computing: A Study in Quantum Architecture Design","version":1},"cited_work":{"arxiv_id":"2307.08191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.08191","snapshot_observed_at":"2026-07-04T08:09:41.940821Z","title":"Liang, J","venue":null,"work_id":"d4fbd1b2-bdc4-489d-bb18-a41514c506fd","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2307.08191","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:cf4f4ac3035c156931b32b2b0188db2bd94c5f2954d73ee0955355522d0eeb2f","observation_id":"0f49a0d9-8768-41c1-a0af-0ce3f0c5d290","resolution":{"observed_at":"2026-05-10T06:31:30.829116Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-02T01:09:26.116796Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2312.03863","doi":"10.48550/arxiv.2312.03863","metadata_source":"pith","pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Effi- cient large language models: A survey.arXiv preprint arXiv:2312.03863","venue":"cs.CL","work_id":"d859363b-b3a3-42c5-861b-b3b7776e4ff7","year":2023},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:a54b796daa40b7e62a254d1f7bc2c0847775f18133edb6084bce01b19c6d48a3","observation_id":"0b92a5b2-d53e-4cbb-90aa-981378b81a51","resolution":{"observed_at":"2026-05-10T06:31:30.836748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:10.21899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:10.21899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6fded65-de29-436f-ae3b-57add9cad7ac","year":2024},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:7affa6a95723266a8a2a7416c0b38a0fa828682d9264ad18340958eaa3f88aec","observation_id":"f1402783-282e-4a23-b33e-67340aeed24a","resolution":{"observed_at":"2026-05-21T16:34:17.393500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"831dcd67-0809-4ff7-921b-226a562f085a","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:35a2158448e87d6467bd0d6c2cc6dc76ce72b06e16147f3e7ccf050eb30ed289","observation_id":"5152f1ce-90b0-4831-8771-e6593bd6f7a3","resolution":{"observed_at":"2026-05-21T16:34:16.940624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM-based cost-aware task scheduling for cloud computing systems.Journal of Cloud Computing","venue":null,"work_id":"86eceb46-4409-461c-9eb6-e44755b193b5","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:2017c15e0eb1160684ebb74ecc469f9f7b70fca7b49b1e015168490ddb029d10","observation_id":"e806a45e-cdc7-457f-a409-f22f2c480eb0","resolution":{"observed_at":"2026-05-21T16:34:16.943139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Green scheduling for LLM workloads with model and data reuse across geo-distributed data centers.Digital Communications and Networks.2025","venue":null,"work_id":"ce17cf96-b43d-41c8-8a21-6de4bb345331","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:d19e6422bd00911bd7e18662f76ebff7d536d1c300d9ba6532fd2b2fac0c7bbd","observation_id":"32bdcac2-74ec-4c92-80f4-a718d4355b33","resolution":{"observed_at":"2026-05-21T16:34:17.388523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":9,"verified_exact":18,"verified_fuzzy":69},"total_outbound_references":151},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 151 outbound references and 2 inbound Pith citation observations for arXiv:2604.17227."}