{"as_of":"2026-08-07T17:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc99a5a7a694bc79afb0470113ff289c98c9addce818fdef3b175cd52230201b","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:42:19.865695Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13093/citation-record","integrity":"/paper/2607.13093/integrity","json":"/paper/2607.13093/citation-record.json","paper":"/paper/2607.13093"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.125500Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.125500Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:6c8d57e67092de04af1f33901d3167aab4f34a70c2d8f939c68ca99602f64058","observation_id":"704996cd-c2f2-4eff-93fe-991f9522c05a","resolution":{"observed_at":"2026-08-02T06:42:15.125500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.165524Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.165524Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:42223b638c3737008ec191eafc604e70b7775ba312ef3ea824156bb64cc1d458","observation_id":"a244b28b-a60f-4a5a-8424-34b6eba53ff3","resolution":{"observed_at":"2026-08-02T06:42:15.165524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.219713Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.219713Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:51b9d270d6f25fc34c74a33b6fb9d0bfd28587c58c1bb6af8a9a6db62979af5c","observation_id":"dbf50e4c-e461-40a9-8de9-8898dd6a5caa","resolution":{"observed_at":"2026-08-02T06:42:15.219713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.254849Z","title":"ORCA: A distributed serving system for transformer-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.254849Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:2b2e2f77aa485c6e49f62589883e0a8114aba051fb3ca83958991a9b7f108789","observation_id":"59aafbdb-ea91-4138-abbc-039fc7e78970","resolution":{"observed_at":"2026-08-02T06:42:15.254849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.308814Z","title":"DeepSpeed-Inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.308814Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:32a26caf854cb924b6319c5eb17c0897fc2fc95a93560b2761c31b9a79bbe91d","observation_id":"9ec4aa2a-05b0-4e4d-9fa1-fbca4f3b12e6","resolution":{"observed_at":"2026-08-02T06:42:15.308814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.386010Z","title":"Neurosurgeon: Collaborative intelligence between the cloud and mobile edge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.386010Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:a416c68cc2447784adb9fa5f80e9f1cc04a16b028ce7b2139c1038516839d0dd","observation_id":"7a3237f2-631f-4397-abe2-2bd07717c460","resolution":{"observed_at":"2026-08-02T06:42:15.386010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.418410Z","title":"Split computing and early exiting for deep learning applications: Survey and research challenges.ACM Computing Surveys, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.418410Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:41566e00950f4d9e81e386d0866b075f6ec8dc2508607bc8007e07e9feeef8d4","observation_id":"a2c8ebfc-c67a-4f6c-8050-c791406b6084","resolution":{"observed_at":"2026-08-02T06:42:15.418410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.469966Z","title":"DNN surgery: Accelerating DNN inference on the edge through layer partitioning.IEEE Transactions on Parallel and Distributed Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.469966Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:41ac7974d68188a7e0670ed4ef1afd9cbdac99aa687be8d5c2b7f2437c38fdef","observation_id":"be4ee5b6-3c18-4bc6-ace7-ce68744ba00a","resolution":{"observed_at":"2026-08-02T06:42:15.469966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.527834Z","title":"Pipeedge: Pipeline parallelism for large-scale model inference on heterogeneous edge devices","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.527834Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5ac47887748ef04729fe78abb158af669c84b8b273661afe72da21df586e9be0","observation_id":"5a7f8188-0c65-4f6f-be70-bde979f3536d","resolution":{"observed_at":"2026-08-02T06:42:15.527834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.597558Z","title":"Hybrid SLM and LLM for edge-cloud collaborative inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.597558Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:6a0511a1147fbdb8b71c4f8adec00b43d49bbb873d80974253ccdd19b3802c58","observation_id":"a3e7d1d7-cc21-4428-a652-4b0f664a237c","resolution":{"observed_at":"2026-08-02T06:42:15.597558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.654481Z","title":"Jupiter: Fast and resource-efficient collaborative inference of generative LLMs on edge devices","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.654481Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:bcc61fcade1e7b4b118809fdc91a539b8521f6ba5286ca31205f077c3507dfa4","observation_id":"33614f3b-2045-4f8a-b6b4-4898256a8cef","resolution":{"observed_at":"2026-08-02T06:42:15.654481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12000","last_updated":"2025-07-17T02:34:42Z","snapshot_observed_at":"2026-08-06T16:53:52.190719Z","submitted_at":"2025-07-16T07:55:06Z","title":"DSSD: Efficient Edge-Device LLM Deployment and Collaborative Inference via Distributed Split Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12000","snapshot_observed_at":"2026-08-02T06:42:15.700801Z","title":"DSSD: Efficient edge-device LLM deployment and collaborative inference via distributed split speculative decoding.arXiv preprint arXiv:2507.12000, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.700801Z"},"links":{"cited_paper":"/paper/2507.12000","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5d6c5d772d0ef86bf10bd038ce739064b860ced11165745c7de1e80a53aa5cbd","observation_id":"50603c84-6301-4705-b54b-b447c97d11af","resolution":{"observed_at":"2026-08-02T06:42:15.700801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.760422Z","title":"CE-CoLLM: Efficient and adaptive large language models through cloud-edge collaboration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.760422Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:54352c7cc5549d1179b6ba324c64fe6f750497b404aaa74425e66a9638b2b51b","observation_id":"cbd50d06-12a4-4179-8465-1e9474670daa","resolution":{"observed_at":"2026-08-02T06:42:15.760422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.840945Z","title":"Edgeshard: Efficient LLM inference via collaborative edge computing.IEEE Internet of Things Journal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.840945Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:7c6371f5e74d2148803ebd4579aaa34f63f7e69c71fcbde15aa4795beee57037","observation_id":"c13880c8-dbdb-41ce-bce7-e66b06bc695c","resolution":{"observed_at":"2026-08-02T06:42:15.840945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16731","last_updated":"2025-07-22T16:13:43Z","snapshot_observed_at":"2026-08-06T15:00:33.300567Z","submitted_at":"2025-07-22T16:13:43Z","title":"Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16731","snapshot_observed_at":"2026-08-02T06:42:15.915097Z","title":"Collaborative inference and learning between edge SLMs and cloud LLMs: A survey.arXiv preprint arXiv:2507.16731, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.915097Z"},"links":{"cited_paper":"/paper/2507.16731","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5a3ccf55d609eaa4fd082994db61ab99305807aaa2ad9cf95168134869511683","observation_id":"a7e64c04-0db6-4448-8b9c-9944903863d4","resolution":{"observed_at":"2026-08-02T06:42:15.915097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.997029Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.997029Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:3fb94bef219067bea53b881382a0b06b7b6712c8fa7842d03fc91c4961e192ba","observation_id":"2094fa64-e73e-443d-b654-c8744521eb64","resolution":{"observed_at":"2026-08-02T06:42:15.997029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.090265Z","title":"Accelerating large language model decoding with speculative sampling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.090265Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:57f0465b79bb2a0ee964f2a2233e7859009d41861f206aab8035cc3b9d3bfedf","observation_id":"8dbfbe5d-4166-42a5-a20c-708869b7b6ef","resolution":{"observed_at":"2026-08-02T06:42:16.090265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.143946Z","title":"Specinfer: Accelerating generative large language model serving with tree-based speculative inference and verification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.143946Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:4156ecafb211537107d8123f5d240c45646f7407643b9306e3f1c1f0a1c126c9","observation_id":"e31208b4-04d7-439c-be8e-37d33de933a9","resolution":{"observed_at":"2026-08-02T06:42:16.143946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.237006Z","title":"Sequoia: Scalable, robust, and hardware-aware speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.237006Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:54e5217dc5a6501db5e77aa92becda124e277d26a7d722324ef316dcea0e37aa","observation_id":"b0df2741-fa12-4b04-ab32-22b12618180a","resolution":{"observed_at":"2026-08-02T06:42:16.237006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.304835Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.304835Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:989942ed191678e26893a61e5a12e96e034c6f258ebedb01dbb90d52e56dfe05","observation_id":"bba04103-6a0d-43b9-b4c3-73db6ab2f825","resolution":{"observed_at":"2026-08-02T06:42:16.304835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.363212Z","title":"EAGLE-2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.363212Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:21c41ecd16696660f67e6c54010573b3a3245f429ff07934359ed02a9299d798","observation_id":"b204fa25-a9b6-4561-ba1f-334675d9b30d","resolution":{"observed_at":"2026-08-02T06:42:16.363212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.391598Z","title":"Break the sequential dependency of LLM inference using lookahead decoding.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.391598Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:80f51d835b60556e587e4be1e444c983ecc41e42639383a9f6bf2ab1fb8eea8b","observation_id":"457a302d-9d3d-4119-ba8a-fa8b5a00785f","resolution":{"observed_at":"2026-08-02T06:42:16.391598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.475568Z","title":"Reddi, and Felix Yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.475568Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5f47b7f4c2318f0cf51feaebc2cb4de2d0888ff335d181b9f26cffdf767c56b1","observation_id":"20f5b314-7564-4fa3-a578-c7ab3c0859ad","resolution":{"observed_at":"2026-08-02T06:42:16.475568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.542612Z","title":"Layerskip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.542612Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:083435e6f3dff12f00c34dd6cfea3148da54c64920fb0ef15a385a6852836e53","observation_id":"a752c88b-db56-45de-bc72-a3f4fe9e945e","resolution":{"observed_at":"2026-08-02T06:42:16.542612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.615010Z","title":"Draft & verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.615010Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:c90b2c76e01d8a05047daac93fc314984794201b7a07f2964bb5c01ae0370f9d","observation_id":"7c4cab50-7dea-4036-aa84-f11339118f41","resolution":{"observed_at":"2026-08-02T06:42:16.615010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.702536Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.702536Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:c4d1c91edd7c5e2ad69620bbe632a3db969d9f34ecf956b0898d195adf396ab6","observation_id":"23008ec9-d20b-479b-b1dc-63915ef94f0b","resolution":{"observed_at":"2026-08-02T06:42:16.702536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.739903Z","title":"QLoRA: Efficient finetuning of quantized LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.739903Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:c940827c3d6229fbcb775ffddb3f1237a9fd1e286b000b6f624c1c17407e6ce6","observation_id":"f66487df-1cd8-46ad-9931-9f26f325fdfb","resolution":{"observed_at":"2026-08-02T06:42:16.739903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00952","last_updated":"2024-07-01T04:13:25Z","snapshot_observed_at":"2026-08-06T08:29:51.313033Z","submitted_at":"2024-07-01T04:13:25Z","title":"SplitLoRA: A Split Parameter-Efficient Fine-Tuning Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00952","snapshot_observed_at":"2026-08-02T06:42:16.876672Z","title":"Splitlora: A split parameter- efficient fine-tuning framework for large language models.arXiv preprint arXiv:2407.00952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.876672Z"},"links":{"cited_paper":"/paper/2407.00952","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:4963bf715e9b4e62d1ae3ede9ab64555847aeefbdd8ec1c3f8c06f79f4f91c4f","observation_id":"8e950cda-cbcb-45d0-8480-7af5fa2c85d0","resolution":{"observed_at":"2026-08-02T06:42:16.876672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12313","last_updated":"2024-03-18T23:20:08Z","snapshot_observed_at":"2026-07-06T17:46:42.199436Z","submitted_at":"2024-03-18T23:20:08Z","title":"Improving LoRA in Privacy-preserving Federated Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12313","snapshot_observed_at":"2026-08-02T06:42:17.098363Z","title":"Improving LoRA in privacy-preserving federated learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.098363Z"},"links":{"cited_paper":"/paper/2403.12313","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:e98a3303302958338c0092ec128933ddbe1471d9a9abedc83486eec310af3564","observation_id":"4798fc88-828b-416f-ae75-d69c30355b48","resolution":{"observed_at":"2026-08-02T06:42:17.098363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.249674Z","title":"On the implicit relation between low-rank adaptation and differential privacy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.249674Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:0efff47486862b92da1ae80e40b5908b2feab47811b01d8bf98d6e94f99931ac","observation_id":"9b9bd033-a26f-4707-8e85-b49ebb328fd1","resolution":{"observed_at":"2026-08-02T06:42:17.249674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.384853Z","title":"Is split learning privacy-preserving for fine-tuning large language models?IEEE Transactions on Big Data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.384853Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:a5b993689cbe9943d9490d3f7bd6e2d567c347655edde270cfd63bf3b03a77a1","observation_id":"87219b76-0a36-4fad-a0be-3076474b4077","resolution":{"observed_at":"2026-08-02T06:42:17.384853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.521863Z","title":"SLDP-LoRA: A privacy-preserving split learning framework with low-rank adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.521863Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:eb3645cbb0c36638f2b1e569050fd9bd3674e50f176423850d1d57f2762a1c92","observation_id":"8a2ee5c0-71e1-41ee-ac6f-15ae965c3402","resolution":{"observed_at":"2026-08-02T06:42:17.521863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09130","last_updated":"2024-08-27T01:28:12Z","snapshot_observed_at":"2026-08-07T17:20:21.307300Z","submitted_at":"2023-10-13T14:17:33Z","title":"Split-and-Denoise: Protect large language model inference with local differential privacy","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09130","snapshot_observed_at":"2026-08-02T06:42:17.678536Z","title":"Split-and-denoise: Protect large language model inference with local differential privacy.arXiv preprint arXiv:2310.09130, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.678536Z"},"links":{"cited_paper":"/paper/2310.09130","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:50dc05a8a25b20baf85a5c4a48580ad90c15beca5ed2e401232c107f13fb9993","observation_id":"c36f73c1-69bf-41a8-95ca-810241f11245","resolution":{"observed_at":"2026-08-02T06:42:17.678536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.851965Z","title":"Santos, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.851965Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5ae1b28e4e2b119316d6849c4a5aba8d46ab74df2b146481c139df334a60da14","observation_id":"1483a785-638b-4235-aaee-269cc19c2a66","resolution":{"observed_at":"2026-08-02T06:42:17.851965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.076697Z","title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.076697Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:e1763b9ccf75e0d319dbc626441bb26188bc7db9d6420f46708800a785e25787","observation_id":"2dc0dd2e-5e5f-4118-8583-d065b60aefcd","resolution":{"observed_at":"2026-08-02T06:42:18.076697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.194038Z","title":"AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.194038Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:8c1fb515361ff2a7a72f235fa7deaf1fad312dd1128362a6361ee41c8b039b14","observation_id":"67ea7582-74b1-4a21-be37-a25d1d408574","resolution":{"observed_at":"2026-08-02T06:42:18.194038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.257172Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.257172Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5c3673cd012d2b36f971c337dc755ce02f706b8c91a29e8a9cec550d325074cf","observation_id":"143f02b4-ff8e-46cf-a862-004b59d02e04","resolution":{"observed_at":"2026-08-02T06:42:18.257172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.321759Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.321759Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:db2651e1e40ca3e86fdfda67361902564120c22f15ceb40b055629a1e4b90f90","observation_id":"7c1bc7fc-10c5-48be-88d3-35dbd3e50c00","resolution":{"observed_at":"2026-08-02T06:42:18.321759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.401946Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.401946Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:36b212358ba8c58a02cf6c607fa087000f28b9c731434b263470e9f535047066","observation_id":"58f287d4-07cc-4f10-bbab-3abaead8bc27","resolution":{"observed_at":"2026-08-02T06:42:18.401946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.479747Z","title":"Efficient LLM inference on CPUs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.479747Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:764342194df697cce642a388d61f5eb541cd53b34f2c2a8fb8d00c2bb27093ed","observation_id":"62123e57-7a91-474e-9325-b83a21c203bc","resolution":{"observed_at":"2026-08-02T06:42:18.479747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.566986Z","title":"H2O: Heavy-hitter oracle for accurate KV cache compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.566986Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:a7341972d4a2fd25bca64a0db65cb04a7204588ed10a9bcdabd0bb11a75751b2","observation_id":"715331ba-a009-48c1-a933-2b3ebe623b87","resolution":{"observed_at":"2026-08-02T06:42:18.566986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.679844Z","title":"Streamingllm: Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.679844Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:83e01c8afb45114ac8737741c1421d2ad873f3471dbe731a889c7a091394c8a0","observation_id":"487eca1a-41f9-4c73-9bdd-671413163a11","resolution":{"observed_at":"2026-08-02T06:42:18.679844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.791543Z","title":"Recommendation for block cipher modes of operation: Ga- lois/counter mode (gcm) and gmac","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.791543Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:b40df9a31a1c6415366794f8aab78e2d157c50d27cbd45a853e1a4d42e18691e","observation_id":"81176a82-252d-409c-ad5d-184fe5b7b48b","resolution":{"observed_at":"2026-08-02T06:42:18.791543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.867792Z","title":"BOLT: Privacy-preserving, accurate and efficient inference for transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.867792Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:078ce8758381996c3823301651afef8ed93418352f3f95ef2f0b5269a5595e89","observation_id":"13e26c63-4711-4bdf-bec6-4480245fafdd","resolution":{"observed_at":"2026-08-02T06:42:18.867792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.969333Z","title":"THE-X: Privacy-preserving transformer inference with homomorphic encryption","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.969333Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:8fbb2569fc46fcc48e1e6276f26a8ebc629f03f79f688897d63c96e79590bbb3","observation_id":"e05b9057-df30-4519-a95a-a42138371044","resolution":{"observed_at":"2026-08-02T06:42:18.969333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.083020Z","title":"Xing, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.083020Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:04d3967dec61b8dadd107ac3ca86e0d6d264b9acf3633797e653c789be7ae824","observation_id":"5369bbcc-5885-4905-9e6a-cf607f584081","resolution":{"observed_at":"2026-08-02T06:42:19.083020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.164171Z","title":"Secureinfer: Heterogeneous TEE-GPU architecture for privacy- critical LLM tensors.arXiv preprint arXiv:2510.19979, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.164171Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:ec6e6ddc0d515622217848c391d3a24c68a72a15c40d5bcf88d265f1a9ed352c","observation_id":"223d5a16-0e04-49b4-8373-640f5860107b","resolution":{"observed_at":"2026-08-02T06:42:19.164171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.238337Z","title":"ONNX Runtime: Cross-platform, high performance machine learning inferencing and training accelerator.https://onnxruntime.ai/","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.238337Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:98967d0bbec0a218b127170253a605df86112bc243b4d8d3524d2d5811299356","observation_id":"31bfd236-2284-4e7d-970a-f89636aeddf0","resolution":{"observed_at":"2026-08-02T06:42:19.238337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10505","last_updated":"2022-09-21T17:05:12Z","snapshot_observed_at":"2026-07-06T13:54:49.290065Z","submitted_at":"2022-09-21T17:05:12Z","title":"Text Revealer: Private Text Reconstruction via Model Inversion Attacks against Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10505","snapshot_observed_at":"2026-08-02T06:42:19.309412Z","title":"Text revealer: Private text reconstruction via model inversion attacks against transformers.arXiv preprint arXiv:2209.10505, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.309412Z"},"links":{"cited_paper":"/paper/2209.10505","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:0328043c6678ee0b6eb503e3213f57eb03fc0bb580c040166b04070097e20d70","observation_id":"02d45801-cac2-4a28-b676-337714cc26d7","resolution":{"observed_at":"2026-08-02T06:42:19.309412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.410428Z","title":"ML-Doctor: Holistic risk assessment of inference attacks against machine learning models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.410428Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:08d6fa3460da73d4c910dbc477aea2f9eb03c7bc64fa5fe9479c29d4b6716d45","observation_id":"555f580a-0501-459e-bbc7-4be1bc3da1d2","resolution":{"observed_at":"2026-08-02T06:42:19.410428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.565403Z","title":"Privacy side channels in machine learning systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.565403Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:7f6c2909cc452f99c6e12afc118f842858190a084056ac9f70df9744dbca6a45","observation_id":"b3620fcb-bd28-4f09-92f5-16b6b7356dd0","resolution":{"observed_at":"2026-08-02T06:42:19.565403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.737748Z","title":"Secure multi-party computation for machine learning: A survey.IEEE Communications Surveys & Tutorials, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.737748Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:23f8a53acae40c64c51e89a0c77b5a64f7e48aa4d6958fe4dec9ce413b175e1c","observation_id":"f26177c0-e00f-4545-a5fe-dece69615396","resolution":{"observed_at":"2026-08-02T06:42:19.737748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.865695Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.865695Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:ec9fe303df6d48d5f27e2fd868b128b1d58ceb77cd334fe115112d8de1249a61","observation_id":"a2cb37e2-5ef6-48ae-8838-00b7e3d2b366","resolution":{"observed_at":"2026-08-02T06:42:19.865695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T09:56:00.274952Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.13093."}