{"as_of":"2026-08-17T21:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:173e824356ff98f3d5357ed331b27cfc2150464c9a98e38540cf6b9f208c318d","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:09:45.699402Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:47:39.121487Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T14:06:38.131407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13437","snapshot_observed_at":"2026-08-07T22:47:39.121487Z","title":"Deploy- ing foundation model powered agent services: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09073","last_updated":"2025-02-13T08:42:29Z","snapshot_observed_at":"2026-08-09T02:49:28.797671Z","submitted_at":"2025-02-13T08:42:29Z","title":"Enhancing RAG with Active Learning on Conversation Records: Reject Incapables and Answer Capables","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T22:47:39.121487Z"},"links":{"cited_paper":"/paper/2412.13437","citing_paper":"/paper/2502.09073"},"observation_digest":"sha256:47bc7ed9038238396bb22336d2138d184af43f1ab0fdf355c293424c24fa5e59","observation_id":"767d2de8-bf3f-4ff9-b7a4-41c62355cd52","resolution":{"observed_at":"2026-08-07T22:47:39.121487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"cited_work":{"arxiv_id":"2412.13437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13437","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deploying foundation model powered agent services: A survey","venue":null,"work_id":"870b1088-9e8b-43be-b350-6dfff1b11c2b","year":2024},"citing_paper":{"arxiv_id":"2505.16120","last_updated":"2026-05-04T12:54:07Z","snapshot_observed_at":"2026-08-15T05:11:46.464906Z","submitted_at":"2025-05-22T01:52:15Z","title":"LLM-Powered AI Agent Systems and Their Applications in Industry","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-22T14:05:54.535411Z"},"links":{"cited_paper":"/paper/2412.13437","citing_paper":"/paper/2505.16120"},"observation_digest":"sha256:7e612c8eaec58dcf3b3fb89c6679ef0b35f06fb91d27786cc5a8641b41357c14","observation_id":"a9a7292d-627d-4ca3-b01f-acf9078e605a","resolution":{"observed_at":"2026-05-22T14:06:38.134799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.13437/citation-record","integrity":"/paper/2412.13437/integrity","json":"/paper/2412.13437/citation-record.json","paper":"/paper/2412.13437"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.779007Z","title":"On the Opportunities and Risks of Foundation Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.779007Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:aa851910fe7b1499a4a4a9c11be7ed9193b407d160edbe27538a8b67b3480c79","observation_id":"6fa4800a-d355-49fe-bf6e-e2b61fe09361","resolution":{"observed_at":"2026-08-11T13:09:44.779007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.792843Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.792843Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:dbf2f94edb226513285314db38dfdbcd0aaa27baaa3c7fc63ef9387a08681463","observation_id":"37ebb9b6-bf7b-485a-9235-9e5908e39e7c","resolution":{"observed_at":"2026-08-11T13:09:44.792843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.802780Z","title":"107 Up-to-Date ChatGPT Statistics & User Numbers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.802780Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:1a7a2cce1d5c30a38ba116367b74f483f76da4dc61c6d922ab8ed6d7a8ca2a90","observation_id":"1efdd7fd-6506-48ec-b5c9-c8293d551286","resolution":{"observed_at":"2026-08-11T13:09:44.802780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.810366Z","title":"A Survey on Hardware Accelerators for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.810366Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e0efe6197681515ca253000dd0d291c652c2e7d042a6ddd3df4a35b4035de9cf","observation_id":"33052f6b-0d67-47ae-988f-9b3c6c585b04","resolution":{"observed_at":"2026-08-11T13:09:44.810366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.818604Z","title":"A Survey on Scheduling Techniques in Computing and Network Convergence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.818604Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:1775b9f88ec863f3550592d2a63f65c2f4038277e7c57aba2762db6d379ea3c0","observation_id":"95954845-4e77-4541-b10c-dcaa0a59abfb","resolution":{"observed_at":"2026-08-11T13:09:44.818604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.826199Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.826199Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:69d7932db0f5723617361dcc721f5c6013b411672978ff4848ee4198e1eb79df","observation_id":"d2a7a6b2-3ea7-4d25-83dd-17da27509e8c","resolution":{"observed_at":"2026-08-11T13:09:44.826199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.833892Z","title":"Unleashing the Power of Edge-Cloud Generative AI in Mobile Net- works: A Survey of AIGC Services,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.833892Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e227880da7167742e3918f2259d51daf11cf038fea0fc4ab8c27168aa5f21916","observation_id":"8c2023fa-f709-4452-8055-df0d414ebf2d","resolution":{"observed_at":"2026-08-11T13:09:44.833892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.839870Z","title":"Machine and Deep Learning for Resource Allocation in Multi-Access Edge Computing: A Survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.839870Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:d6129c1887bc5a5c48a694a08912a73b5b8f908d4247632d1fd1513dc8363d45","observation_id":"3fed0e64-dd77-42c9-a911-0c71f61ca0e6","resolution":{"observed_at":"2026-08-11T13:09:44.839870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.846821Z","title":"A Survey of Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.846821Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:fd6de492cd9f8e3a91ae74b4638acf1186ff69f2821deb083cddac2d55ae007e","observation_id":"793af5de-f3cc-4c38-b0ed-9d1eeab33b4e","resolution":{"observed_at":"2026-08-11T13:09:44.846821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.854139Z","title":"A Comprehensive Overview of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.854139Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:f2a5ec26a1d8b5752bf07b7c60997f79906d2f4a0efcc659160f2e7f76c1af74","observation_id":"badc3e58-19fe-452c-93a1-e05524f3d910","resolution":{"observed_at":"2026-08-11T13:09:44.854139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.863625Z","title":"A Survey on Model Compression for Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.863625Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4a8978166bb41af08c116e71292873583f60a6b6d00df251e08991602c198905","observation_id":"9df22d56-6622-40bc-8c33-4066fd3767dc","resolution":{"observed_at":"2026-08-11T13:09:44.863625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.869985Z","title":"Model Compression and Efficient Inference for Large Language Models: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.869985Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e5cb68f122aa3608f8e0dcd07e5567593d41dd0579512bab37b7864e6130f5fd","observation_id":"effbb557-e21f-4d1d-adb0-efc5b6fadc44","resolution":{"observed_at":"2026-08-11T13:09:44.869985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-11T13:09:44.875640Z","title":"A survey on knowledge distillation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.875640Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:220802fbef62eb7d0383d1e08940e7c1472667e5732abd9b1ffccd6c52336053","observation_id":"78f134e6-b2b7-460c-b33e-400b8e0aa1d9","resolution":{"observed_at":"2026-08-11T13:09:44.875640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.881689Z","title":"A survey on large language model based autonomous agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.881689Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:b1de74583b3c8c8f4fe9d89babc5dd31bbf2e195bcf11ac4d58087437ca2eb8c","observation_id":"b40e5f34-c181-4e85-b872-a94fb6508daf","resolution":{"observed_at":"2026-08-11T13:09:44.881689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-10T13:10:07.804621Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-11T13:09:44.887811Z","title":"Large language model based multi-agents: A survey of progress and challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.887811Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:73fa1c89cd386bb92c3b77547ea337b8bfbeea66a39789797a0ce72cfb57306a","observation_id":"e73b7eed-4e37-4425-a734-0fdf64dbceb1","resolution":{"observed_at":"2026-08-11T13:09:44.887811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.894927Z","title":"FedDSE: Distribution-aware Sub-model Extraction for Fed- erated Learning over Resource-constrained Devices,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.894927Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:58907dab9f73bb5cebdc85ae7982d8246c4e3d20a53b54bf89bc1b77a65331f0","observation_id":"10afd8dd-fe79-4ae4-bf9f-f99442365c87","resolution":{"observed_at":"2026-08-11T13:09:44.894927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.902027Z","title":"Hardware accelerator for multi-head attention and position-wise feed-forward in the trans- former,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.902027Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:c4c52022915b4ff4bc37a011848a65d2b7200144ef988c751f10294ba795d0bd","observation_id":"36e0b7aa-c032-4dc6-b092-48b6d5dc29b7","resolution":{"observed_at":"2026-08-11T13:09:44.902027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.909274Z","title":"Mnnfast: A fast and scalable system architecture for memory-augmented neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.909274Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4b57632851e7a1b607627afb341b8792f51078dd0bd63647b8fd8ceeaa1c2b17","observation_id":"00dc1268-87da-4ba2-b2d0-8b143623b051","resolution":{"observed_at":"2026-08-11T13:09:44.909274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06535","last_updated":"2021-04-13T22:34:33Z","snapshot_observed_at":"2026-08-16T18:31:48.349750Z","submitted_at":"2021-04-13T22:34:33Z","title":"NPE: An FPGA-based Overlay Processor for Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06535","snapshot_observed_at":"2026-08-11T13:09:44.916243Z","title":"Npe: An fpga-based overlay processor for natural language processing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.916243Z"},"links":{"cited_paper":"/paper/2104.06535","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e29274bcdd1c301dbe84645c348ec0adfa092eb3b28dfc353bdaee3085a6ca3e","observation_id":"6e2db958-2a28-479b-b2ac-7d27222e241f","resolution":{"observed_at":"2026-08-11T13:09:44.916243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.923086Z","title":"Dfx: A low-latency multi-fpga appliance for accelerating transformer- based text generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.923086Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:14d0ad1861aad6a760d556261759fa6edcdbfae07cb764e70518f57d0d7b52b5","observation_id":"9c3b5ec6-566f-4bf4-9f14-e5cd3356b8c2","resolution":{"observed_at":"2026-08-11T13:09:44.923086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.931785Z","title":"Transformer- opu: An fpga-based overlay processor for transformer networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.931785Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:13f3c2979a603b429f14e0c86d53780ab636d780f72a1dac5a6eb9ccd1c9993d","observation_id":"958d7f88-e6d5-4c14-8d05-db571355d9c0","resolution":{"observed_at":"2026-08-11T13:09:44.931785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02721","last_updated":"2024-10-17T07:44:51Z","snapshot_observed_at":"2026-08-16T14:29:39.515065Z","submitted_at":"2024-01-05T09:32:39Z","title":"A Cost-Efficient FPGA Implementation of Tiny Transformer Model using Neural ODE","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02721","snapshot_observed_at":"2026-08-11T13:09:44.938941Z","title":"A cost-efficient fpga imple- mentation of tiny transformer model using neural ode,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.938941Z"},"links":{"cited_paper":"/paper/2401.02721","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:d2ed349622451bb8aadb3d445b6f5bd4268a4b436ab9ff40e3b14a8938495cb0","observation_id":"25e56444-1341-4d47-8ccb-c5297de9bf2f","resolution":{"observed_at":"2026-08-11T13:09:44.938941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03868","last_updated":"2024-01-09T06:47:46Z","snapshot_observed_at":"2026-08-17T04:43:59.970614Z","submitted_at":"2024-01-08T13:00:53Z","title":"FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03868","snapshot_observed_at":"2026-08-11T13:09:44.947506Z","title":"Flightllm: Efficient large language model inference with a complete mapping flow on fpga,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.947506Z"},"links":{"cited_paper":"/paper/2401.03868","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:7f85f468f897a53a4a925a1f6a1d9152914c80d94e10e48bfc346dc9deec77cf","observation_id":"8d850878-d709-4225-905f-2e22e90ae9f6","resolution":{"observed_at":"2026-08-11T13:09:44.947506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.958912Z","title":"Aˆ 3: Accelerating attention mechanisms in neural networks with approximation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.958912Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:9c7deb861ece198e2fee2e8ffd6d488b0938d7e26a82b3eb89dd00fce361b0dc","observation_id":"9a83747f-a5dd-475a-b5c3-16531a638ed5","resolution":{"observed_at":"2026-08-11T13:09:44.958912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.971634Z","title":"Elsa: Hardware-software co-design for efficient, lightweight self- attention mechanism in neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.971634Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:25e87aa13242ee9a3318b698790e81fd70044bd71d1553a3fe17abeace9d4c6c","observation_id":"92be0b6b-b2b9-43a5-801f-ef4f8f2a3cad","resolution":{"observed_at":"2026-08-11T13:09:44.971634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.978791Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.978791Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:97e178982b365dd2c6fea154e15d181fb3a081224d656767a9ed5bd0e83a6415","observation_id":"c1c09a46-5180-4830-a000-4d930dc38e50","resolution":{"observed_at":"2026-08-11T13:09:44.978791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:44.996917Z","title":"Sanger: A co-design framework for enabling sparse attention using reconfigurable architecture,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:44.996917Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:98a4a3c2c6bb031393665fbf9d7f52133a04d73d31ace6ec1cef0206fb142e5a","observation_id":"a1fc3833-4dbd-4d2b-b44a-06ffe9b0e933","resolution":{"observed_at":"2026-08-11T13:09:44.996917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.003951Z","title":"Energon: Toward efficient acceleration of transformers using dynamic sparse attention,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.003951Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:3b1131fb685f589774f41f5affe4162bda501547ba544fea30d64b19c927ab44","observation_id":"5551b2b3-0629-40e1-be89-8a4260699275","resolution":{"observed_at":"2026-08-11T13:09:45.003951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.017639Z","title":"Att: A fault-tolerant reram accelerator for attention-based neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.017639Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:095981c1fc3d5fd85b0ca2324ea76ea085891cfbe75b74b351da4732860f6ffd","observation_id":"a7f72601-fa9a-48ec-9c8b-5477c2f56578","resolution":{"observed_at":"2026-08-11T13:09:45.017639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.025799Z","title":"In-memory com- puting based accelerator for transformer networks for long sequences,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.025799Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:59cd19da12838eb40bf2b10c428b537c07dc5b8e3c3bf971cb532fc84967c081","observation_id":"c9bf2ea7-a315-4215-ab99-37163a26b14e","resolution":{"observed_at":"2026-08-11T13:09:45.025799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.032215Z","title":"Work in progress: Real-time transformer inference on edge ai accelerators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.032215Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:a024f590bc4f310545b5d6394eb773dac99e3eefd8f6739cae74ece75220e572","observation_id":"d268528a-6776-44ed-bacb-755be315ab66","resolution":{"observed_at":"2026-08-11T13:09:45.032215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01906","last_updated":"2024-05-31T11:14:16Z","snapshot_observed_at":"2026-08-16T14:46:13.359223Z","submitted_at":"2023-11-03T13:30:52Z","title":"Simplifying Transformer Blocks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01906","snapshot_observed_at":"2026-08-11T13:09:45.044288Z","title":"Simplifying transformer blocks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.044288Z"},"links":{"cited_paper":"/paper/2311.01906","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:cb8afa8fc2152aa7604bc3fd2c8f0485009daa6d266e42499c21df96c10bddcb","observation_id":"1165d6dd-7cfd-4073-a9aa-474fb5fe93d7","resolution":{"observed_at":"2026-08-11T13:09:45.044288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.053937Z","title":"Accelerating transformer networks through recomposing softmax layers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.053937Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:df723cb85c86f3a9fd0cb1af280ba3bd724c6bbb60a00686aefd5963ef877154","observation_id":"3359070c-c84a-43bc-af38-20c5e8f4957b","resolution":{"observed_at":"2026-08-11T13:09:45.053937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04487","last_updated":"2023-04-10T09:55:14Z","snapshot_observed_at":"2026-08-16T15:41:37.758542Z","submitted_at":"2023-04-10T09:55:14Z","title":"Inference with Reference: Lossless Acceleration of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04487","snapshot_observed_at":"2026-08-11T13:09:45.062703Z","title":"Inference with reference: Lossless acceleration of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.062703Z"},"links":{"cited_paper":"/paper/2304.04487","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:2b7cf9cb9e21ab850ee175df3233c63a7e2363939a0fe48a737714059d07d650","observation_id":"1d4ce839-6ebc-417f-8c23-3babb8e89872","resolution":{"observed_at":"2026-08-11T13:09:45.062703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10770","last_updated":"2023-11-21T06:59:59Z","snapshot_observed_at":"2026-08-16T14:42:58.323856Z","submitted_at":"2023-11-15T18:42:50Z","title":"Exponentially Faster Language Modelling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10770","snapshot_observed_at":"2026-08-11T13:09:45.072049Z","title":"Exponentially faster language mod- elling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.072049Z"},"links":{"cited_paper":"/paper/2311.10770","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:50280236761aaf6ca8477448786224cc30d458576699b24c2ff5773450c19671","observation_id":"4489ab2f-f63f-459b-a8c0-2dc647e6af75","resolution":{"observed_at":"2026-08-11T13:09:45.072049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00502","last_updated":"2023-12-07T12:16:42Z","snapshot_observed_at":"2026-08-16T14:46:52.725822Z","submitted_at":"2023-11-01T13:08:50Z","title":"Efficient LLM Inference on CPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00502","snapshot_observed_at":"2026-08-11T13:09:45.080567Z","title":"Efficient llm inference on cpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.080567Z"},"links":{"cited_paper":"/paper/2311.00502","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:bb265acea964c9668420d180685a4824e06b8862f98f7daeea68100af17e28e5","observation_id":"70d4e60c-576b-4e68-b3e0-ccfa1aa6eb3d","resolution":{"observed_at":"2026-08-11T13:09:45.080567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12456","last_updated":"2024-12-12T12:38:12Z","snapshot_observed_at":"2026-08-16T14:34:13.719836Z","submitted_at":"2023-12-16T02:27:00Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12456","snapshot_observed_at":"2026-08-11T13:09:45.091178Z","title":"Powerinfer: Fast large language model serving with a consumer-grade gpu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.091178Z"},"links":{"cited_paper":"/paper/2312.12456","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e4bdcde728f86b90db87f859f579cc3f6fe0ab3ed142d6eed050a5655777b59a","observation_id":"937ce440-38e5-4671-ba2b-0b4e032edc80","resolution":{"observed_at":"2026-08-11T13:09:45.091178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01164","last_updated":"2024-03-02T10:37:21Z","snapshot_observed_at":"2026-08-16T14:13:30.811854Z","submitted_at":"2024-03-02T10:37:21Z","title":"HeteGen: Heterogeneous Parallel Inference for Large Language Models on Resource-Constrained Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01164","snapshot_observed_at":"2026-08-11T13:09:45.100032Z","title":"Hetegen: Het- erogeneous parallel inference for large language models on resource- constrained devices,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.100032Z"},"links":{"cited_paper":"/paper/2403.01164","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:cbd7568dc79003c255c924bc6097919953ba0e2b87c427c4c29f8855da44d751","observation_id":"78edecc1-f912-4d40-81f1-8d8254a6173a","resolution":{"observed_at":"2026-08-11T13:09:45.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.111120Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.111120Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:7b685291898c6b685032a60986ab3dd588f302e56cc076e036e3b28c2a5af27d","observation_id":"8b9fe4ed-e832-4f3e-9ae6-38af59082e21","resolution":{"observed_at":"2026-08-11T13:09:45.111120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.118529Z","title":"Deja vu: Contextual sparsity MANUSCRIPT 35 for efficient llms at inference time,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.118529Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:6d15955e8d7b7c47da9f77cd835bbe74769c654bfe92689efec782946a99f4ac","observation_id":"0832d36a-a6b7-4033-b45b-c30a5519f097","resolution":{"observed_at":"2026-08-11T13:09:45.118529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-08-16T14:35:22.530960Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-11T13:09:45.128373Z","title":"Llm in a flash: Efficient large language model inference with limited memory,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.128373Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:b415e833b5e20f19763705e528c2d045e4f39a7dd5d94fc34824f5d533a3cec5","observation_id":"2a5fadc7-b381-441b-b00e-acea44634311","resolution":{"observed_at":"2026-08-11T13:09:45.128373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-11T13:09:45.137019Z","title":"Fast transformer decoding: One write-head is all you need,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.137019Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:a77c64239f44d1a1522c0d5561e3892c37f8dd53159e04c7e38f130730cfa79b","observation_id":"a79fbb82-f456-40d1-b78c-a8626196ad55","resolution":{"observed_at":"2026-08-11T13:09:45.137019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.143695Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.143695Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:da1313b83624a0598c9b8ae777fe61a98912c5fe19bd8d7c96ccef56ee99d91e","observation_id":"3747b98c-656e-4eef-a35c-82d65972b90e","resolution":{"observed_at":"2026-08-11T13:09:45.143695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.151153Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.151153Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:66a87b7cf52a897822f3f067517787e7a652d6946bbf660460a562ed0d02813a","observation_id":"72700bc9-a544-44a5-8d29-d84ad4447e8f","resolution":{"observed_at":"2026-08-11T13:09:45.151153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.157005Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.157005Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:13d039457a12e03b0f152969b2a2fb26a0bfe6eb3cba4e7df07b2b9f4b9762ed","observation_id":"d7ca7edd-d7ea-4fd8-8611-14655cb66182","resolution":{"observed_at":"2026-08-11T13:09:45.157005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-11T13:09:45.164356Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.164356Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:65011ad470a0078c2e7b5cec7687bf5de8aefa2e913a1c3dda9c03b4b5820b86","observation_id":"81063395-0423-41e5-a02b-197af16a1802","resolution":{"observed_at":"2026-08-11T13:09:45.164356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-08-16T14:46:31.226431Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-08-11T13:09:45.171490Z","title":"Flashdecoding++: Faster large language model inference on gpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.171490Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:42b14dcae9b5122930ee50caa25502a9e4acef81c7ba41560ef5539249098cf1","observation_id":"b2d271f7-4f40-4f20-acc7-8e835381542a","resolution":{"observed_at":"2026-08-11T13:09:45.171490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.182893Z","title":"Bminf: An efficient toolkit for big model inference and tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.182893Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:a85d85bc85dad8bb9b1a7523d8b4f6b65bca1ceb77968cb4315b8e993dbd2e54","observation_id":"89d0c1cc-4114-44ce-963c-016e6aa6f9fa","resolution":{"observed_at":"2026-08-11T13:09:45.182893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-16T14:38:46.729665Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-11T13:09:45.192998Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.192998Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:bb49acf54c7e27a9d4476a3f101d4a57cc0be41a85c1334035a859f62ab5a958","observation_id":"a3b902e7-1f47-49c9-bd53-b728007f5130","resolution":{"observed_at":"2026-08-11T13:09:45.192998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-16T21:53:57.298060Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-11T13:09:45.199950Z","title":"Fast distributed inference serving for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.199950Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:1c07de89b4b17fbbe1f7a9b8b93e383b7d704181f038ff1340a89257fb391b4f","observation_id":"d86ed139-674d-41c4-8fcf-2198a5f43e87","resolution":{"observed_at":"2026-08-11T13:09:45.199950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.206519Z","title":"Specinfer: Accelerating generative large language model serving with speculative inference and token tree verification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.206519Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:6f7cbb47e117781d577e194f867b67ef5e7314fe2b2a69c03f8e664f9cd73d97","observation_id":"5571c984-08c6-4e1f-9b6a-89dce54e8ef9","resolution":{"observed_at":"2026-08-11T13:09:45.206519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04255","last_updated":"2023-09-08T10:44:19Z","snapshot_observed_at":"2026-08-16T15:02:17.601613Z","submitted_at":"2023-09-08T10:44:19Z","title":"LLMCad: Fast and Scalable On-device Large Language Model Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04255","snapshot_observed_at":"2026-08-11T13:09:45.214235Z","title":"Llmcad: Fast and scalable on-device large language model inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.214235Z"},"links":{"cited_paper":"/paper/2309.04255","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:d75258746e8a9c3c76467141ad2776d74b78e3e868540fc99e018dc56fd59ff4","observation_id":"31ee100c-7934-4068-9c2a-4b4055b25329","resolution":{"observed_at":"2026-08-11T13:09:45.214235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.224317Z","title":"Deepspeed-moe: Advancing mixture- of-experts inference and training to power next-generation ai scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.224317Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4f794eb85b7925e0d006a1e356dec8a0fc7799f572a892d2849693900a9a8dfc","observation_id":"8694023e-a2d2-4efa-9872-f6cbd7e881db","resolution":{"observed_at":"2026-08-11T13:09:45.224317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14352","last_updated":"2025-03-07T11:16:40Z","snapshot_observed_at":"2026-08-16T15:05:22.426273Z","submitted_at":"2023-08-28T06:56:08Z","title":"EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14352","snapshot_observed_at":"2026-08-11T13:09:45.233641Z","title":"Edgemoe: Fast on-device inference of moe-based large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.233641Z"},"links":{"cited_paper":"/paper/2308.14352","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4728a161e7d8427fff37017af19616ee1f3a7d76264f30176590c29ba2150f4c","observation_id":"07db7bd8-db2d-4a4b-a1ab-19d0b9b6def2","resolution":{"observed_at":"2026-08-11T13:09:45.233641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-17T17:41:53.701156Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-11T13:09:45.244176Z","title":"Fast inference of mixture-of-experts lan- guage models with offloading,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.244176Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:0a5c84e8b9dc10e97032d5454e1e23bc966def5da480949103887a299a080734","observation_id":"05763e97-7237-497d-8947-ffbd0783a2d1","resolution":{"observed_at":"2026-08-11T13:09:45.244176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-16T14:24:28.560017Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-11T13:09:45.250980Z","title":"Moe-infinity: Activation- aware expert offloading for efficient moe serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.250980Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:328a4da743bf0cabc3354191514446889f76467e54d5e520d44aa63c42ac57c4","observation_id":"b8ffe746-a7fa-4456-b87f-0f53b7471532","resolution":{"observed_at":"2026-08-11T13:09:45.250980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07033","last_updated":"2025-05-01T09:58:34Z","snapshot_observed_at":"2026-08-16T14:19:38.353904Z","submitted_at":"2024-02-10T19:54:08Z","title":"Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07033","snapshot_observed_at":"2026-08-11T13:09:45.263239Z","title":"Fiddler: Cpu-gpu orchestration for fast inference of mixture-of-experts models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.263239Z"},"links":{"cited_paper":"/paper/2402.07033","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4ea8ec71c9bed5be97b932888a2c362d5041b51fe93a7c7d331ea2006377a1b1","observation_id":"ffd3fa2d-16e1-4bf8-b077-17f94695450d","resolution":{"observed_at":"2026-08-11T13:09:45.263239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12066","last_updated":"2024-04-27T09:11:44Z","snapshot_observed_at":"2026-08-16T15:06:24.718934Z","submitted_at":"2023-08-23T11:25:37Z","title":"Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12066","snapshot_observed_at":"2026-08-11T13:09:45.279321Z","title":"Pre-gated moe: An algorithm-system co-design for fast and scalable mixture-of-expert inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.279321Z"},"links":{"cited_paper":"/paper/2308.12066","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:fd741ef12eeba7f3635a2b7a3ca43f2a04d10e2e349457b4073f43455b71a6e0","observation_id":"14284966-53a6-48d0-bcf5-ea3fbd966e5c","resolution":{"observed_at":"2026-08-11T13:09:45.279321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.291684Z","title":"Intelligence-endogenous management platform for computing and network convergence,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.291684Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4ab96dade974da1fd328e889a54f3502f68dac1e9e054b8f25f03cfbd6266fa1","observation_id":"861938d7-6021-4c73-925d-0e00fa6017a8","resolution":{"observed_at":"2026-08-11T13:09:45.291684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19016","last_updated":"2024-03-27T21:19:21Z","snapshot_observed_at":"2026-08-16T14:05:42.806629Z","submitted_at":"2024-03-27T21:19:21Z","title":"Resource Allocation in Large Language Model Integrated 6G Vehicular Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19016","snapshot_observed_at":"2026-08-11T13:09:45.300538Z","title":"Resource allocation in large language model integrated 6g vehicular networks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.300538Z"},"links":{"cited_paper":"/paper/2403.19016","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:96fe8a6acda5ef8a06386fa0ac169cc8b45cb84c9ca5769e70f6473391b942f2","observation_id":"01cd9dab-518c-438f-8e77-076f2480bfad","resolution":{"observed_at":"2026-08-11T13:09:45.300538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00388","last_updated":"2023-12-01T07:19:42Z","snapshot_observed_at":"2026-08-16T14:38:34.057007Z","submitted_at":"2023-12-01T07:19:42Z","title":"LinguaLinked: A Distributed Large Language Model Inference System for Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00388","snapshot_observed_at":"2026-08-11T13:09:45.307664Z","title":"Lingualinked: A distributed large language model inference system for mobile de- vices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.307664Z"},"links":{"cited_paper":"/paper/2312.00388","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:72b0d52560d44139db82a4e3b099f25d4be2f3210538ac060cab70bf3c350674","observation_id":"732159fa-0d3a-4387-926b-34cf931f7aaa","resolution":{"observed_at":"2026-08-11T13:09:45.307664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.323472Z","title":"{MegaScale}: Scaling large language model training to more than 10,000 {GPUs},","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.323472Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:ec78ee94ce5c9e486826fdd808ef92088313560a474eb88349344c239c12e938","observation_id":"f77681b2-d7a4-4b67-afc8-0caeb7c5479d","resolution":{"observed_at":"2026-08-11T13:09:45.323472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.330947Z","title":"LOSP: Overlap synchronization parallel with local compensation for fast dis- tributed training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.330947Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:04a509be89e234c7bd391aae4558b70eb6f4ec3f08e30cb2eb665a90ee3cb441","observation_id":"efb56433-4b92-4de0-a47c-80068e1bf697","resolution":{"observed_at":"2026-08-11T13:09:45.330947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.342869Z","title":"Heterogeneous semantic and bit communications: A semi-noma scheme,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.342869Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:d70893509ecd9fda5fb8d5f2d8e90ae98aa8f3d741f99eca731b644a182c41dc","observation_id":"8867df43-c025-4684-909d-8fdcb7c72fc3","resolution":{"observed_at":"2026-08-11T13:09:45.342869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.358217Z","title":"Computing networks enabled semantic communications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.358217Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:504312ee2f0616f5cb77f806e22427567286c8f2cf4cf3ae564749f0c51b4b67","observation_id":"5b693c08-7272-44e3-801e-307799372b04","resolution":{"observed_at":"2026-08-11T13:09:45.358217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.366842Z","title":"ggerganov/llama.cpp: Port of facebook’s llama model in c/c++","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.366842Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:f43d30b45a7698a8dacadc2699e9c022a59ac19efa56d4cde7fb1162d0ead16a","observation_id":"ca6f87d5-ed48-48c3-b37d-5f7c7f2e949f","resolution":{"observed_at":"2026-08-11T13:09:45.366842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.378727Z","title":"MLC-LLM,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.378727Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:69c82e67d0bb688699ced522bca7a76e851d06f686c1eb5b95559f5c988aab48","observation_id":"355bf72e-8e52-436a-957a-85c990b00ab7","resolution":{"observed_at":"2026-08-11T13:09:45.378727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.386862Z","title":"mnn-llm: llm deploy project based mnn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.386862Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:97beab1bde19c5874d9ad01d8bce9716df66c9dd938c7fdd1172f2ac0aa18233","observation_id":"98ccf142-2d37-402e-839a-b6cda2190e1f","resolution":{"observed_at":"2026-08-11T13:09:45.386862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.399188Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.399188Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:a0b0263056a2c880c3f1a0cebd6ef8ec118781a9970d5ae72ea981cc0f9b02a5","observation_id":"3c0dadb3-33c4-4dc4-af41-ded901776204","resolution":{"observed_at":"2026-08-11T13:09:45.399188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.407081Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.407081Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4cb7447a8008d76e78c20adfc10c520a3aa41013694db0e0c1a9eb7eb54341ad","observation_id":"c4b2c57f-13c2-48b3-904f-b38640a1a19a","resolution":{"observed_at":"2026-08-11T13:09:45.407081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.417285Z","title":"Openvino deep learning workbench: Comprehensive analysis and tuning of neural networks inference,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.417285Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:34032aa2a6b7bf69396b76790cee51b57544da62a89309010e71bd3cd65b639a","observation_id":"76dd67d8-c208-490e-aa92-810664184221","resolution":{"observed_at":"2026-08-11T13:09:45.417285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.428842Z","title":"mllm is a fast and lightweight multimodal llm inference engine for mobile and edge devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.428842Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:ca8dbb5433f9c1a59aec9201f3902b8a6778d91d6492e5e3d059ceccf2bcd2fd","observation_id":"b6b6abe1-10ed-42f3-a287-6dd4b7d766ba","resolution":{"observed_at":"2026-08-11T13:09:45.428842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14112","last_updated":"2024-03-04T02:30:21Z","snapshot_observed_at":"2026-08-16T14:24:35.794995Z","submitted_at":"2024-01-25T11:46:38Z","title":"FP6-LLM: Efficiently Serving Large Language Models Through FP6-Centric Algorithm-System Co-Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14112","snapshot_observed_at":"2026-08-11T13:09:45.435290Z","title":"Fp6-llm: Efficiently serving large language models through fp6-centric algorithm-system co-design,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.435290Z"},"links":{"cited_paper":"/paper/2401.14112","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:bcc0dd059ce0276145ad8bd6f6dc8e88009d2a4f3f8e50c9f2bb74147a93c3ce","observation_id":"a60b3c2a-b243-4907-8aaa-b2139f5b397e","resolution":{"observed_at":"2026-08-11T13:09:45.435290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.442991Z","title":"Colossal-ai: A unified deep learning system for large-scale parallel training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.442991Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:0e4144276786f4f5d7aafdf957ffe5c80122ed7d2a990bd089bd83301e2e4db4","observation_id":"dad5ea92-7201-457d-948a-d4a6b5fbf9e8","resolution":{"observed_at":"2026-08-11T13:09:45.442991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.451469Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.451469Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:da9cd4f11d4f721c7c8441d2f9a487ad77495c4a6dbe62fc1150553e9d69c034","observation_id":"bcbcdd4f-44a3-46f7-8ca4-ededf8da6f03","resolution":{"observed_at":"2026-08-11T13:09:45.451469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.459594Z","title":"A tensorrt toolbox for optimized large language model inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.459594Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:00311e061382073510d9b079a493816456cb3281bd7a15cf1bc71732c5c111ec","observation_id":"96fc2a21-cc3a-4522-9d46-b0e91f7abd4d","resolution":{"observed_at":"2026-08-11T13:09:45.459594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.466233Z","title":"Langchain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.466233Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:5b5f2bfd82546aedc2ab915f6ddacca4224df68b7420849dfa425d0fe5a9a71e","observation_id":"b23bdc69-310f-4295-a139-8d59289bf32c","resolution":{"observed_at":"2026-08-11T13:09:45.466233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.471857Z","title":"Parrot: Efficient Serving of LLM-based Applications with Semantic Variable,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.471857Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:cd45c5363aae4686e50766f6fe86902ff43542aa4da71e17641fd4eb076d3779","observation_id":"a3d30d45-072f-4778-8262-918ba436cc0d","resolution":{"observed_at":"2026-08-11T13:09:45.471857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.478780Z","title":"SGLang: Efficient Execution of Structured Language Model Pro- grams,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.478780Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:51c8a77d9ba90a64a4c0d01d0b348ecff74c2396ac6c00e3d1a1449d2476b76a","observation_id":"8b942c15-3a46-48dc-9f52-a0090250d19e","resolution":{"observed_at":"2026-08-11T13:09:45.478780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.484686Z","title":"Clipper: A {Low-Latency} online prediction serving system,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.484686Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e0c199e73a723fc2465aecc552960ca384fad320a8d68c81cb97608086a0b85c","observation_id":"ac887d7e-c96a-413e-9f9a-e6ee15b42898","resolution":{"observed_at":"2026-08-11T13:09:45.484686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.491891Z","title":"{MArk}: Exploiting cloud services for {Cost-Effective},{SLO-Aware} machine learning infer- ence serving,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.491891Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:eaa4260a324399f849af6a5396409d51ff13327b88faaee88dcb12f1ae782115","observation_id":"8c75d58a-cda4-4079-844a-492d2e914a6c","resolution":{"observed_at":"2026-08-11T13:09:45.491891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.503290Z","title":"Nexus: A GPU cluster engine for accelerating DNN-based video analysis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.503290Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:df15918eae04751d4be94aec671c722ea242ac76b0c168d6d1394f51d5b22522","observation_id":"030d2edc-7d65-408f-9de6-48f87d81d57a","resolution":{"observed_at":"2026-08-11T13:09:45.503290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.512310Z","title":"InferLine: latency-aware provisioning and scaling for prediction serving pipelines,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.512310Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:bd44d9652e44b68f81f99c734d50b6faa0022c6f915b4f76586bf514898f0fb9","observation_id":"ebeae4ce-07a8-4d6e-9af6-25ef18f0038c","resolution":{"observed_at":"2026-08-11T13:09:45.512310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.523724Z","title":"Serving {DNNs} like clockwork: Performance predictability from the bottom up,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.523724Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:d6c212f34e550d9ee3998feaf1befc9d09fb29ce3f5620968152ac11c8b2ca6f","observation_id":"7ec38905-e53b-4d14-93f1-d35f6ff26610","resolution":{"observed_at":"2026-08-11T13:09:45.523724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.535944Z","title":"{INFaaS}: Automated model-less inference serving,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.535944Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:3fb85bb6574987f88b9a2fff6a685637eab52dce2b0f19efa7d0614143d7ff81","observation_id":"12c97abf-1e7e-4adf-b179-3bb11cb4d26a","resolution":{"observed_at":"2026-08-11T13:09:45.535944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.548707Z","title":"Morphling: Fast, near-optimal auto-configuration for cloud- native model serving,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.548707Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e921f527f04e46cc23747beb5079ce609de9e37a83b2dc5663b78e0619a08ed5","observation_id":"79c828ba-4997-41a6-9011-2abe536cc5ef","resolution":{"observed_at":"2026-08-11T13:09:45.548707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.561212Z","title":"Cocktail: A multidimensional optimization for model serving in cloud,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.561212Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:4ce44e99a5d43f0bcc98fe673ce848c4b888b4b8257c02dd7840d71003cf84c2","observation_id":"f59425d5-cc09-42a4-b12e-e8e0c3df4370","resolution":{"observed_at":"2026-08-11T13:09:45.561212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.571495Z","title":"Kairos: Building cost- efficient machine learning inference systems with heterogeneous cloud resources,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.571495Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:3ae6afe80201ab635754bdc170886b6432d03a27843d14cbd1b7bd8983d48cc0","observation_id":"29ff4f30-31c1-442b-9fa4-ac8997312935","resolution":{"observed_at":"2026-08-11T13:09:45.571495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.577939Z","title":"{SHEPHERD}: Serving {DNNs} in the wild,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.577939Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:101657e3be3c7bb0e1b57c9c3ec5e1943d229dec892bd05a60e17d7d6f6897fc","observation_id":"7b50d3ce-3ab0-4234-a896-ecbe3508f2a7","resolution":{"observed_at":"2026-08-11T13:09:45.577939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15566","last_updated":"2023-11-27T06:31:17Z","snapshot_observed_at":"2026-08-16T14:40:12.049078Z","submitted_at":"2023-11-27T06:31:17Z","title":"SpotServe: Serving Generative Large Language Models on Preemptible Instances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15566","snapshot_observed_at":"2026-08-11T13:09:45.586601Z","title":"Spotserve: Serving generative large language models on preemptible instances,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.586601Z"},"links":{"cited_paper":"/paper/2311.15566","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:3b977eee68298fbeedd11d24f38e47fb4f9884b97a819ae6f0d66b71e2b773b5","observation_id":"07bab909-0504-446c-9e35-980890ebb3d3","resolution":{"observed_at":"2026-08-11T13:09:45.586601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.596352Z","title":"Frequency resource allocation and interference management in mobile edge com- puting for an Internet of Things system,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.596352Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:9170b358c27750bdb0447cf3f7b4a3a9d8daeac7cf21517abff19c3640e8917a","observation_id":"6f08276c-940a-4d38-85f2-0977bf46de00","resolution":{"observed_at":"2026-08-11T13:09:45.596352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.606093Z","title":"Decentralized resource auctioning for latency-sensitive edge computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.606093Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:8f6c0d00710e2387613d3ca354bf337f98d1f09472a99350cf90292b4d6227f2","observation_id":"7b68c0dc-42db-45fb-a4aa-edffeab85ec5","resolution":{"observed_at":"2026-08-11T13:09:45.606093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.618571Z","title":"Joint computation partitioning and resource allocation for latency sensitive applications in mobile edge clouds,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.618571Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:bb075b528c4f6e209705efac8412832552cbe7ed55f1d168189d65002df25d3f","observation_id":"84201086-57d4-4728-b300-9db4c5e69dcd","resolution":{"observed_at":"2026-08-11T13:09:45.618571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.629199Z","title":"Adaptive computation offloading and resource allocation strategy in a mobile edge computing environment,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.629199Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:b4f057f33ff49427e7fb8d3d4214350ddffadd19cb2f57a6578c0306b15dd2dc","observation_id":"4724aa46-9daf-4365-9e04-376fe80dc311","resolution":{"observed_at":"2026-08-11T13:09:45.629199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.639635Z","title":"Resource allocation based on deep reinforcement learning in IoT edge computing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.639635Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:0f67b3e53629267d990982feea722dc5b239246490bd7dd69b36aa29f009b279","observation_id":"7c911632-5049-4b4d-9ba5-b8a73f4032fc","resolution":{"observed_at":"2026-08-11T13:09:45.639635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.655729Z","title":"CE-IoT: Cost-effective cloud- edge resource provisioning for heterogeneous IoT applications,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.655729Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:e95d64248a9ef876f085af99064fbc92519167346843d4a7106df04f215f164f","observation_id":"dd23b577-6374-47c8-88ce-3c09a1d6d2d5","resolution":{"observed_at":"2026-08-11T13:09:45.655729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.667356Z","title":"Dynamic resource allocation and computation offloading for IoT fog computing system,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.667356Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:fd49361cd7088eb8d1219c90f8ff1b14c6481a7048ee089844dc360633372eaa","observation_id":"5f2b4c56-efc9-4244-9b74-fa68f59b551f","resolution":{"observed_at":"2026-08-11T13:09:45.667356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.679429Z","title":"Lass: Running latency sensitive serverless computations at the edge,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.679429Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:773fc2a1923d757e652fcbd854ec6edd2a6924a063396432874947045547e768","observation_id":"22f70170-8dd8-47b5-95ed-e6cd26485d8a","resolution":{"observed_at":"2026-08-11T13:09:45.679429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.686643Z","title":"Resource provisioning and allocation in function- as-a-service edge-clouds,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.686643Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:15953c8c7eae1aecd3b8d85331437ab7d184dab71947522106ce4fc2eec83f39","observation_id":"d0cabc15-1ee0-429e-89e6-962312b923ca","resolution":{"observed_at":"2026-08-11T13:09:45.686643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:45.699402Z","title":"KneeScale: Efficient resource scaling for serverless computing at the edge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:45.699402Z"},"links":{"citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:8eaf7a68ae60f90dc1b552d51ec7eaee5b084739662902243da763158ca063fc","observation_id":"cb3aa6b7-dbae-48d6-ba56-9f0d6eb62aa8","resolution":{"observed_at":"2026-08-11T13:09:45.699402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-13T15:09:37.690476Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 2 inbound Pith citation observations for arXiv:2412.13437."}