{"as_of":"2026-08-23T13:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e1bb7c884d4c738182ba8818a0c6a4d8518c633531c754b44877083ac86be4c","coverage":[{"denominator":162,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:20:30.299592Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T07:45:22.445395Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T07:45:29.205817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"cited_work":{"arxiv_id":"2506.02847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02847","snapshot_observed_at":"2026-07-01T07:45:29.205817Z","title":"arXiv preprint arXiv:2506.02847 , year =","venue":null,"work_id":"0bbb643f-7e55-4a99-b81d-d2856411fa04","year":null},"citing_paper":{"arxiv_id":"2606.30662","last_updated":"2026-06-17T07:01:20Z","snapshot_observed_at":"2026-08-14T13:01:26.831157Z","submitted_at":"2026-06-17T07:01:20Z","title":"ELEVATE: Designing Human-Centered GenAI Virtual Tutors for Scalable and Inclusive Education","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-01T07:45:22.445395Z"},"links":{"cited_paper":"/paper/2506.02847","citing_paper":"/paper/2606.30662"},"observation_digest":"sha256:ba1d6e199e5988c76d15ab43cb8a1e476bb6fd5e51450082b76eda3f7b1ae449","observation_id":"175381e9-f139-44de-8324-94595eb56e89","resolution":{"observed_at":"2026-07-01T07:45:29.207153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02847/citation-record","integrity":"/paper/2506.02847/integrity","json":"/paper/2506.02847/citation-record.json","paper":"/paper/2506.02847"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:29.361870Z","title":"Rewind: A better way to search your digital life, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.361870Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:ab7df4ccbc7f74ba5977563db4b21e9860efde3b232c53d5affd485be76eed47","observation_id":"3cc23a94-ad17-4c6c-92a8-25b94e6a0924","resolution":{"observed_at":"2026-08-07T11:20:29.361870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:29.442444Z","title":"An open-source framework for autonomous soc design with analog block generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.442444Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a6cdf5cc7fdbc23f37e30fc29cf3de66fd6a9b8ab13f3330362f10d85e0b62d0","observation_id":"897b39d5-ddef-4220-98f7-a17bea375f7f","resolution":{"observed_at":"2026-08-07T11:20:29.442444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:29.637143Z","title":"The illustrated gpt-2 (visualizing trans- former language models).Jalammar","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.637143Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:33979138d48f1388bf7309c1ba8984e7dbda29099062771a839049662360ebf8","observation_id":"a3fd116f-ad1c-453a-82d5-acdf9a3eced5","resolution":{"observed_at":"2026-08-07T11:20:29.637143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-08-19T12:40:37.732356Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-07T11:20:29.786243Z","title":"Del Mundo, Mohammad Rastegari, and Mehrdad Farajtabar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.786243Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f1a422519d28137c9702d2e6420590e7236fc463011605ac3f36773ff62361cd","observation_id":"a21b22ec-6027-4945-98ae-68596982659f","resolution":{"observed_at":"2026-08-07T11:20:29.786243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:29.817687Z","title":"Claude: A family of ai models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.817687Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:16ef66b7fc0859ea709d3bc5e8766431ed6fe0048a1250ce2f56c77e2e9c78ba","observation_id":"292e48e6-24ab-42f0-8ff2-9c9d8af50a64","resolution":{"observed_at":"2026-08-07T11:20:29.817687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:29.972873Z","title":"Apple intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.972873Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f65e3b1d50d84dae01dea40c860f8f242b72d9e25921005f1f88a27fff0bd63e","observation_id":"64d336f0-d870-4a8c-bd09-1d635053d3fa","resolution":{"observed_at":"2026-08-07T11:20:29.972873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:29.980912Z","title":"Apple siri: Virtual assistant, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.980912Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:935de9e838defd3ddcf70bedd4e108aff4d9aa95bc181aa50d03bc2a2e267ed3","observation_id":"ff3fe49a-584b-442e-8c18-875471b3ad65","resolution":{"observed_at":"2026-08-07T11:20:29.980912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-16T14:24:10.346445Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-07T11:20:29.984809Z","title":"Croci, Marcelo Gen- nari Do Nascimento, Torsten Hoefler, and James Hens- man","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.984809Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:50dddb710eddc0351ff07e66990981a70d6c1d84a150c0e5919accb5b3b6bfc4","observation_id":"3c47924d-2585-4a07-af14-b99b5b35ee21","resolution":{"observed_at":"2026-08-07T11:20:29.984809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:29.988251Z","title":"25.1 a fully synthesizable distributed and scalable all-digital ldo in 10nm cmos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:29.988251Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:6ccdcaa3582d8f6740dec18f44bac8f2cb05975348a21174ee52a089fba1d8ee","observation_id":"37fd1495-cc8f-4f20-9b83-914429bddfe3","resolution":{"observed_at":"2026-08-07T11:20:29.988251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.033790Z","title":"{NeuOS}: A {Latency- Predictable}{Multi-Dimensional} optimization frame- work for {DNN-driven} autonomous systems","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.033790Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:c93314f9a58d2ddd1a0af1c58bd53e9cc26ec83436b1cdb76222571099427369","observation_id":"e7146166-892c-4f84-bf31-4346bce7de12","resolution":{"observed_at":"2026-08-07T11:20:30.033790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.037121Z","title":"Bender, Timnit Gebru, Angelina McMillan- Major, and Shmargaret Shmitchell","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.037121Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:452a6a0897f468acb7ff424565290264dc85a38488dfcf701a1e5d3eec26a5c5","observation_id":"18e0b18a-e656-4515-b77f-133a1022c919","resolution":{"observed_at":"2026-08-07T11:20:30.037121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.040052Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.040052Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:fd42de9013f798e9831ad5bab4eaa961b84d8eaef75dad56a35dd6c3229881a4","observation_id":"095e4547-b476-4382-8ec6-99492013f2b9","resolution":{"observed_at":"2026-08-07T11:20:30.040052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T11:20:30.043082Z","title":"Hudson, Ehsan Adeli, Russ B","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.043082Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:3c38011e1417dd37a69a7cce7b429a543b55e20a305ea89513e26677a9df4b97","observation_id":"0ceb2af1-898b-4870-97cc-203e0d496c8a","resolution":{"observed_at":"2026-08-07T11:20:30.043082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.046628Z","title":"An estimate of an upper bound for the entropy of english","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.046628Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:04c5157d59e7b9fc72d2343ced1d7bfe89c1b75ecffe6700bbccc945338798ee","observation_id":"da7612c2-af60-4652-a382-cd1498fb8143","resolution":{"observed_at":"2026-08-07T11:20:30.046628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.049551Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.049551Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:e019fe222d644a137004b4d7c75b6c5a3e6e859a0873b8b38b4a27a256f65f09","observation_id":"7f5a3be4-0875-4749-9f67-3d1821e7fdb4","resolution":{"observed_at":"2026-08-07T11:20:30.049551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.052735Z","title":"A fre- quency compensation scheme for ldo voltage regula- tors.IEEE Transactions on Circuits and Systems I: Regular Papers, 51(6):1041–1050, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.052735Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:839efc5ef214e934fa603dbd94f483c145af50f85af1ad70024d2d733257bd00","observation_id":"6e89f9a1-9fd3-4cf6-a3df-6948022d7d73","resolution":{"observed_at":"2026-08-07T11:20:30.052735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.055847Z","title":"Bge m3-embedding: Multi- lingual, multi-functionality, multi-granularity text em- beddings through self-knowledge distillation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.055847Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:b5192bf862b3e8f740fa1169845442519296e3fd2ab5596ab019c94b1efc7566","observation_id":"3838fe1c-f4e0-4005-9923-c6954dca22e9","resolution":{"observed_at":"2026-08-07T11:20:30.055847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.058717Z","title":"Op- timizing energy efficiency of browsers in energy-aware scheduling-enabled mobile devices","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.058717Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:6fb85d02388330ddae37a576b5ee91f687e0dd5dbfd7560da0fa644c84ced095","observation_id":"a3ea6e24-12bb-45ea-8dfd-9c691b9bacf5","resolution":{"observed_at":"2026-08-07T11:20:30.058717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.061530Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.061530Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:89245e85d1b5f1940f0c584eb863f9b89dc7889902ea97eec56ce6493f41925d","observation_id":"872e40fe-bb1c-4730-8535-aacdb0088def","resolution":{"observed_at":"2026-08-07T11:20:30.061530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.064298Z","title":"ML.ENERGY leaderboard","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.064298Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:4bd26e3b166a79407237a41d77f0ed62a0dda3e6074ede1c58a454ec8ba4d7a9","observation_id":"77a962fe-6853-4879-b4d7-000581fb08d1","resolution":{"observed_at":"2026-08-07T11:20:30.064298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.066924Z","title":"Hechtman, Trevor Cai, Sebastian Borgeaud, George van den Driessche, Eliza Ruther- ford, Tom Hennigan, Matthew J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.066924Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:9c1e34a9060816c99141eb48a0d05c1f568133eb330f8b699102b693d4e141f5","observation_id":"45893bdb-be31-49d0-9e61-c067e8026f8c","resolution":{"observed_at":"2026-08-07T11:20:30.066924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.069780Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.069780Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:1a3f02e1a1bfdbe3deb5e742b1053bf50c929589432bcf570d420c012cf354c4","observation_id":"7fc02c78-a21c-4b6f-aad3-4c110cdd1624","resolution":{"observed_at":"2026-08-07T11:20:30.069780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:20:30.072546Z","title":"Think you have solved ques- tion answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.072546Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:3240fc979a4f5871207eab33764ef50d31c6f0ac109c67d25910ad4de66bd039","observation_id":"64ffa5f7-1128-4cae-b93d-847c1d46ee0a","resolution":{"observed_at":"2026-08-07T11:20:30.072546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.075288Z","title":"Track and reduce co2 emissions from your computing.https://codecarbon.io/, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.075288Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:21f3506909e61671879bda0d8023861d7515174f4dbb60311a84b36fc10f1b83","observation_id":"d4b4ae27-2128-4ce2-a496-5b21c0ba3f82","resolution":{"observed_at":"2026-08-07T11:20:30.075288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.077959Z","title":"Llama 2: Inferencing on a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.077959Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:372f5c14a06d95e2e655d985821c60aa193a8c65d98bc93a322d613eea3c427f","observation_id":"796f6d98-7a46-477d-a3bb-58d44d4844a3","resolution":{"observed_at":"2026-08-07T11:20:30.077959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.081219Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.081219Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:ccd66cace550c2c240799c48444f402dc1c8b550f2ba122d603aaf46641b6bbf","observation_id":"604a50a1-60b3-4f03-9137-e059d4a4020c","resolution":{"observed_at":"2026-08-07T11:20:30.081219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.083937Z","title":"Pruner- zero: Evolving symbolic pruning metric from scratch for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.083937Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:691d45d1b768b53e3b37497be3d2aac0fa9c7732a1ea8c3dbbe5e62f9ba7d4a9","observation_id":"64368e54-f293-4069-ae4d-d84d825cc5ef","resolution":{"observed_at":"2026-08-07T11:20:30.083937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.086587Z","title":"User-aware frame rate man- agement in android smartphones.ACM Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.086587Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a95be5eebb3fa674a014fbba854fd31863d9d5b935fcdfa8fcc9b6e838f89a54","observation_id":"8f2949f7-6d06-4034-a4f3-653ce46f9761","resolution":{"observed_at":"2026-08-07T11:20:30.086587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.089369Z","title":"Bradley Chen, and Margo I","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.089369Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:226f90c389c3614a571c535718c5327ccbcd91dce0452ef4c697a997c75908bb","observation_id":"041a2a81-ab56-44b6-b9db-db536e6254ae","resolution":{"observed_at":"2026-08-07T11:20:30.089369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.092261Z","title":"Depgraph: Towards any struc- tural pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.092261Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f01132434ce18aeb43ebdff863dc943147e24e508ce533e0356828e095b4a594","observation_id":"9583e905-eaa1-44e8-9835-575700d5f855","resolution":{"observed_at":"2026-08-07T11:20:30.092261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.095081Z","title":"Gpt-3: Its nature, scope, limits, and consequences.Minds and Machines, 30:681–694, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.095081Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a64f4958f71766f49fa02508c3e1d2bc1578128dd88a688edc183f2acd2c3485","observation_id":"de9f1fce-d890-4ca5-b48d-1f823c8af701","resolution":{"observed_at":"2026-08-07T11:20:30.095081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.097575Z","title":"Sparsegpt: Massive language models can be accurately pruned in one- shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.097575Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:eb1e7e3c9c78e5e1d117d48d1f53d069dd27a41024ee026fe18fcea9207b6a43","observation_id":"fb189c35-5f9d-45bd-9114-056fddd214de","resolution":{"observed_at":"2026-08-07T11:20:30.097575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.100144Z","title":"Beam search strategies for neural machine translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.100144Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:7b007d7c187f46f55d9bdd6d7a2f8df411aa93007e24f044e358ebff8adedf8a","observation_id":"b55ce9d8-21c3-4720-9cd7-b87bd6aeaafd","resolution":{"observed_at":"2026-08-07T11:20:30.100144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.103379Z","title":"Drive like a human: Rethinking autonomous driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.103379Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f1a061e75cf89959f300b73a03e0f394e3444d78da207617caf099281ea2f0f6","observation_id":"69364cba-1976-45da-a39a-b3df3fead741","resolution":{"observed_at":"2026-08-07T11:20:30.103379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.106009Z","title":"Openllama: An open reproduction of llama","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.106009Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:39be838bcc5229ae1ca46db97fe3594c09b5d197380fa7159d1904c7e8c41d8b","observation_id":"c860af55-87db-4946-83fd-00f015302dff","resolution":{"observed_at":"2026-08-07T11:20:30.106009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.108661Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.108661Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:28f9e2f6f12b63723b3b1283bd9085a9543d6cc4e703b536a3615500976f78c7","observation_id":"b4d77d22-77ec-4e93-8ea0-00aa98e048e2","resolution":{"observed_at":"2026-08-07T11:20:30.108661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.111229Z","title":"GitHub Copilot: Your AI pair programmer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.111229Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a80dcd7b598f814f2cc0f7ebc7ccc934d5362743e2690247d961d3855c0c4e47","observation_id":"f17d1f1f-d07a-4a6d-8309-55bc9119823b","resolution":{"observed_at":"2026-08-07T11:20:30.111229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.114160Z","title":"Goodfellow, Yoshua Bengio, and Aaron C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.114160Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f22eb45a4d132523a115e8976ff5375becb407cbac4df69345c2525cc6ec8bc2","observation_id":"f64bbe97-1e6f-42d7-84fa-8450a8f60850","resolution":{"observed_at":"2026-08-07T11:20:30.114160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.117045Z","title":"Google assistant, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.117045Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:3ff9a8f6a530cda481c969f4a2f50583a23a339e6830ceb247b10ac6d78257ec","observation_id":"5b3382f0-4364-4c1c-9d32-74e10676352e","resolution":{"observed_at":"2026-08-07T11:20:30.117045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.119676Z","title":"Ml kit smart reply, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.119676Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:465e4bc4ad964bed23015f2793c36b8b68fbb83b95c0789e65d320ee21534d86","observation_id":"1f2bac2c-c034-4d83-a651-89bceb96265b","resolution":{"observed_at":"2026-08-07T11:20:30.119676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.122280Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.122280Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:799bf2bd3ff665e537b3f7189b9024cf47c1d14ef3eb9a4bad6610c3b1f42868","observation_id":"1cf2c75c-bcf0-4cef-ae89-6262d90269b6","resolution":{"observed_at":"2026-08-07T11:20:30.122280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.125464Z","title":"Mistify: Au- tomating DNN model porting for on-device inference at the edge","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.125464Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:56a16fec63e62ebd2f9b20ed924a9b173c25f9ba5e31361af9a9fcc46041f055","observation_id":"48647cfb-269f-4b74-8277-6b6b16bd0223","resolution":{"observed_at":"2026-08-07T11:20:30.125464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.128612Z","title":"A reconfigurable floating- point compute-in-memory with analog exponent pre- processes.IEEE Solid-State Circuits Letters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.128612Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a4289afe3d37ad2ed36faa2e4c8593bb98b8a272fa95ff0316b0282f0d7cba7c","observation_id":"abdec490-9ec9-40c3-a893-4c638a35bc0f","resolution":{"observed_at":"2026-08-07T11:20:30.128612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.131269Z","title":"A 28nm 314.6 tl- fops/w reconfigurable floating-point analog compute- in-memory macro with exponent approximation and two-stage sharing td-adc","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.131269Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:1aeaf0e7a151c542eb2da36c842de8c730cf53ff48a918d1b762ad9abd0d4445","observation_id":"7239543f-7a02-46bb-af68-8a51fc5d189c","resolution":{"observed_at":"2026-08-07T11:20:30.131269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.133896Z","title":"Channel pruning for accelerating very deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.133896Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:92c4c568861866a6ca9a6c317b822a32f38060c099f137a9e28088565a7220e0","observation_id":"7a24dfbc-92cc-4df8-b7c9-58ab85a82f62","resolution":{"observed_at":"2026-08-07T11:20:30.133896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.136923Z","title":"Measuring massive multitask language under- standing.Proceedings of the International Conference on Learning Representations (ICLR), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.136923Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:03a0b33faf10046108d4f56bf1414f96d89ac0ef8dc7f56c796530e52b401aea","observation_id":"3b98e9c1-f26a-465a-a724-b3405b37e79f","resolution":{"observed_at":"2026-08-07T11:20:30.136923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.139632Z","title":"Variation- aware dynamic voltage/frequency scaling","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.139632Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f970d6b300b01b90f3022da836065cda62f6dc0789b66fd76397719120c09f69","observation_id":"2b1be03e-9e80-478b-a717-7833c3102880","resolution":{"observed_at":"2026-08-07T11:20:30.139632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.144325Z","title":"Enright Jerger","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.144325Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:0cd37c2e980c21b72b1e31bb842a8410de275290e0e637d8021811a3ae30a8dc","observation_id":"3076f9ce-ad6b-40d4-a7f6-57c4a6c43403","resolution":{"observed_at":"2026-08-07T11:20:30.144325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.147171Z","title":"Long short- term memory.Neural Comput., 9(8):1735–1780, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.147171Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:1322dd34fd362d381a6b28089f9a0644d1f3f7160ab31fb009542f97d811d416","observation_id":"be61a365-d8c8-4190-8266-e7c23b044d80","resolution":{"observed_at":"2026-08-07T11:20:30.147171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.150467Z","title":"The curious case of neural text degener- ation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.150467Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:22c9cf2b3d947733a117691c1dd322c062826e461cd16718e315ddb24b59bc14","observation_id":"2da47bce-206d-4cbc-bf0d-15b02dbbbcda","resolution":{"observed_at":"2026-08-07T11:20:30.150467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.153381Z","title":"An all-digital phase-locked loop (adpll)-based clock re- covery circuit.IEEE Journal of Solid-State Circuits, 34(8):1063–1073, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.153381Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:1ccac546b4f9ae1ce1631c32483bf28657e690a03a9844125ed6531c3e954ed4","observation_id":"769eb812-4ae8-4723-981d-74af0549f181","resolution":{"observed_at":"2026-08-07T11:20:30.153381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:20:30.156139Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.156139Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:07fc0b51fae5eb9618098a70f8a8177c7f1c0cc52eeda26689abba65e15406d8","observation_id":"0e8d0a00-0354-4f0b-b5f2-80aecb7af26f","resolution":{"observed_at":"2026-08-07T11:20:30.156139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.159598Z","title":"CAMA: energy and memory efficient automata pro- cessing in content-addressable memories","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.159598Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:e34b61be101942bbac69b82a7ae8c728548c86fe20a87f1fa21c5f8dd7b58448","observation_id":"e817ff94-a586-40ec-b214-43b09edf3e5e","resolution":{"observed_at":"2026-08-07T11:20:30.159598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.162218Z","title":"New solutions on llm acceleration, optimization, and application","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.162218Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:92ebe98c51b4eb12c5d3f2bd2dda6a979e4d1e3218709ec00496ae10943c0719","observation_id":"7ad978e9-5856-4fc0-bbdc-2241e8622759","resolution":{"observed_at":"2026-08-07T11:20:30.162218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.164863Z","title":"Quantized neural networks: Training neural networks with low precision weights and activations.Journal of Machine Learning Research, 18(187):1–30, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.164863Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:2a1dde80d36fe9369ba96f7f5739a8dedc3aba06ec4800c748844da82b73b34e","observation_id":"4046c736-b798-4d42-bbf3-8fc7fd4dfbd2","resolution":{"observed_at":"2026-08-07T11:20:30.164863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.167284Z","title":"Transformers documentation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.167284Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:5778a0228ccb797573ae1908f934d9c6b4691d7b56fe556e7e9e53df51b5e86b","observation_id":"e44aefa9-87c3-44f0-9c7d-885b1066a2ea","resolution":{"observed_at":"2026-08-07T11:20:30.167284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.170049Z","title":"Just-in-time quan- tization with processing-in-memory for efficient ml training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.170049Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:66b504cd55156eb958ff3d5ca8eea82ab09452398f04d50feff3900e3cb8a5e6","observation_id":"dd6a8791-f9bb-4329-98a7-ca39f72f9408","resolution":{"observed_at":"2026-08-07T11:20:30.170049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.172888Z","title":"Mem: Your ai-powered assistant, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.172888Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:0b02b835205ec9dfb9618cfe32c0f5914760a4c65b33da1236b03d5fb72a74f9","observation_id":"62b91761-3cec-42f8-afd2-f5ed8fe933ca","resolution":{"observed_at":"2026-08-07T11:20:30.172888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.175585Z","title":"Jacobs, Michael I","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.175585Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:22913ff72fa09d0fe78c8c2e6894720c9ab194cfd5d365d1734c389de312616a","observation_id":"0ae7c0b3-7caf-4ebf-8247-e6c83b4ee226","resolution":{"observed_at":"2026-08-07T11:20:30.175585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16712","last_updated":"2024-08-07T19:59:00Z","snapshot_observed_at":"2026-08-19T18:43:09.197563Z","submitted_at":"2023-10-25T15:34:30Z","title":"LLM Performance Predictors are good initializers for Architecture Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16712","snapshot_observed_at":"2026-08-07T11:20:30.178185Z","title":"Llm performance pre- dictors are good initializers for architecture search","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.178185Z"},"links":{"cited_paper":"/paper/2310.16712","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a813d21ddb5bc13b8634a1aa42988d6a30e340d0df2df29e18ee8c288bd87958","observation_id":"4277b1f4-5a03-4635-a0e8-8f9341c6abf5","resolution":{"observed_at":"2026-08-07T11:20:30.178185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.181453Z","title":"Robot control using llama: Bridging ai and robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.181453Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:69f803574c563f5b01e9784ca96992c88b3151089952a5448278feb3966ae864","observation_id":"6ba7c83e-72ad-4c44-a7ee-3a26fcd32dd4","resolution":{"observed_at":"2026-08-07T11:20:30.181453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.184097Z","title":"Reinforcement learning: A survey","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.184097Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a4b0d0717ccab9372f7adc1f3cd2a81c8a050644fce1fc34216a5a892a72e984","observation_id":"0b1b9f69-d1c5-48c1-91d7-7e49efbd5bae","resolution":{"observed_at":"2026-08-07T11:20:30.184097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:20:30.186985Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.186985Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:fed5482d29dedcbef36ff5da049e827106a3a340bd049c5b7c372d9c6a612c84","observation_id":"a6b9963e-b9fd-4107-9ffc-84269b40d97d","resolution":{"observed_at":"2026-08-07T11:20:30.186985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.189680Z","title":"The breakthrough memory solutions for improved performance on LLM inference.IEEE Micro, 44(3):40–48, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.189680Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:742766764001b843227152bbc38e1f6e281cb6aaf39b44e91315320981245637","observation_id":"7f2b5ecd-04d7-45cd-92e9-9f66ec8858a7","resolution":{"observed_at":"2026-08-07T11:20:30.189680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.192366Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.192366Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:9222dd765d1363f13ea35a8d926b0d96cbfc606b22cfff2c28876ea4cd7f512d","observation_id":"3ee029fc-4609-43f4-acf9-f06ae3e5facb","resolution":{"observed_at":"2026-08-07T11:20:30.192366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.195212Z","title":"Enhancing energy efficiency of multimedia applications in heterogeneous mobile multi-core pro- cessors.IEEE Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.195212Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:b8fc0e47156e04d4bf57ac0421a22de51982dcda9be87cd4649d90c7997f7ce6","observation_id":"2bf5eddd-c825-4b65-be80-2450cca854f1","resolution":{"observed_at":"2026-08-07T11:20:30.195212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.198205Z","title":"A novel gpu power model for accurate smartphone power break- down.ETRI journal, 37(1):157–164, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.198205Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:64534407a03fb3441cc0c434ecb2e99847eb74211ab18454c5f869ad89b5aa22","observation_id":"9ee46a44-a1a5-448b-a0a4-d3304c65b046","resolution":{"observed_at":"2026-08-07T11:20:30.198205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.200853Z","title":"A survey on recent os-level energy management tech- niques for mobile processing units.IEEE Trans","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.200853Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:0997d04b2738dda12b9b55ada496db2a30fd61b181e601acf6006c2e9b734049","observation_id":"86b60bfc-362f-4f65-8a48-0116df482eed","resolution":{"observed_at":"2026-08-07T11:20:30.200853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.203498Z","title":"Autoscale: Energy efficiency optimization for stochastic edge in- ference using reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.203498Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:44abde7b8abdcd601628db1cb4f85d4709da6cf669a9d51fafefd57a53f85ed7","observation_id":"b39b6851-d81f-407a-9acb-e2da44f62b94","resolution":{"observed_at":"2026-08-07T11:20:30.203498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.206434Z","title":"InProceedings of the Fourteenth EuroSys Conference 2019, pages 1–15, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.206434Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:8af00225a5fd56505e47be837bf4ae718c1ec19b9a10ef1bfa0401f0fb2436ff","observation_id":"83517662-138f-4b16-a548-541351317bda","resolution":{"observed_at":"2026-08-07T11:20:30.206434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.209192Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.209192Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:5800403ccf9ffcfe7b9962ba64b6b6ce867e1d4b8f41cfc6c54f02b9b2aba7f3","observation_id":"408bd45e-875e-4fbf-9849-faeb181c09ed","resolution":{"observed_at":"2026-08-07T11:20:30.209192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.212076Z","title":"Resnet 50.Convolu- tional neural networks with swift for tensorflow: image recognition and dataset categorization, pages 63–72, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.212076Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:54d36fb9cc335e783ba7519db3474dd255f4cf8ce8c1ac57de69f4399940e964","observation_id":"ef5cbf70-b35e-42c5-a755-0304a781186f","resolution":{"observed_at":"2026-08-07T11:20:30.212076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.215564Z","title":"Automatic domain-specific soc design for autonomous unmanned aerial vehicles","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.215564Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f926f9f21549c603b820b47276dfa3efe656f2195ee20dda48d259f95e07dedf","observation_id":"f794a6a5-a485-4ecc-afbf-392b83569178","resolution":{"observed_at":"2026-08-07T11:20:30.215564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.221498Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.221498Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:1d973b0d2c00bc45eed25bd5e1bd1bbd867306a804a08b76ee917d627076106c","observation_id":"bd950b1a-20b4-48bc-8374-9fbc7b8b3643","resolution":{"observed_at":"2026-08-07T11:20:30.221498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.224331Z","title":"Deep learning.nature, 521(7553):436–444, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.224331Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:47486eaacd174b474994c212ae41612b1a65187794ad86332772a7714df067b5","observation_id":"ed56dd15-8d16-4366-9676-5900aa6c51d3","resolution":{"observed_at":"2026-08-07T11:20:30.224331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.227272Z","title":"On-chip memory technology design space explorations for mobile deep neural network ac- celerators","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.227272Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:66c961e318d081747082fb9930bccc98e73ddb73f471c8c42cc6f159ce750b5a","observation_id":"69cebccd-b948-40af-afd5-fdc2c4638e23","resolution":{"observed_at":"2026-08-07T11:20:30.227272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.230317Z","title":"Energydx: Diag- nosing energy anomaly in mobile apps by identifying the manifestation point","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.230317Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:6436c116feb302ff75e40c7ae73a6e0ded86e320f6df6268ee3d2a425e5333e5","observation_id":"8e1ddf1c-7d40-4158-a804-d0e42df8fa37","resolution":{"observed_at":"2026-08-07T11:20:30.230317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07274","last_updated":"2018-11-26T04:56:31Z","snapshot_observed_at":"2026-08-15T10:58:31.329286Z","submitted_at":"2017-01-25T11:52:11Z","title":"Deep Reinforcement Learning: An Overview","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07274","snapshot_observed_at":"2026-08-07T11:20:30.233137Z","title":"Deep reinforcement learning: An overview","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.233137Z"},"links":{"cited_paper":"/paper/1701.07274","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:9fa57729c07318e661c1eadc97720c26c57c760161719df442bd8d2133904ed8","observation_id":"bf6dc3b1-2e9c-4e64-b001-e5d0b9c9fdb9","resolution":{"observed_at":"2026-08-07T11:20:30.233137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.236152Z","title":"From system 1 to system 2: A survey of reasoning large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.236152Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:6a56f0ed5fe52ecfe9ac4a46c3bb95ac4a386778a4d8f31736cf49678981b24f","observation_id":"7d60f56d-b849-4140-a9e7-34fe8f407d3e","resolution":{"observed_at":"2026-08-07T11:20:30.236152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06371","last_updated":"2023-12-15T06:42:42Z","snapshot_observed_at":"2026-08-17T01:49:02.526191Z","submitted_at":"2023-12-11T13:27:51Z","title":"BAT: Behavior-Aware Human-Like Trajectory Prediction for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2312.06371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06371","snapshot_observed_at":"2026-08-07T11:20:30.963530Z","title":"BAT: Behavior-Aware Human-Like Trajectory Prediction for Autonomous Driving","venue":"cs.RO","work_id":"960fbbd3-ff10-4282-8e1c-d4a3940ea3c6","year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.238811Z"},"links":{"cited_paper":"/paper/2312.06371","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:8181b2ca1515ec460c3dd83fca2c3ad81bf0f6b6ae662cdb480c6d2fb0b88b84","observation_id":"1bf5fe12-fd98-4833-86a1-03a882af4dd2","resolution":{"observed_at":"2026-08-07T11:20:30.967973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.241803Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.241803Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:1c7d1b898757868baaaf914973fee2a6c639b43b486a1e14f0ce420817fed2d2","observation_id":"1ebb0ba8-a885-4001-b269-92f25beac8d0","resolution":{"observed_at":"2026-08-07T11:20:30.241803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.244455Z","title":"Par- rot: Efficient serving of llm-based applications with semantic variable","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.244455Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:0460989f8fab1e3c359c112c2cda9e0d00367f42c6e0c7faf680d55be89f58d1","observation_id":"4280d027-617c-4a5a-bd68-8ef290974005","resolution":{"observed_at":"2026-08-07T11:20:30.244455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-07T11:20:30.250265Z","title":"AWQ: activation-aware weight quantization for LLM compression and acceler- ation.CoRR, abs/2306.00978, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.250265Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:5fdfc344b95a8e93fd2fb8ab0979ddf1f4e651a4303edbc2582e93ebfea4e5ed","observation_id":"8415a56a-8d5e-4c2f-ab47-0708dbf0f757","resolution":{"observed_at":"2026-08-07T11:20:30.250265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.253352Z","title":"A rein- forcement learning-based power management frame- work for green computing data centers","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.253352Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:2c6700825af68cf8c7de9481695855fd3e95f774620052e35e1a2e1816da0469","observation_id":"fd8ff174-7f99-4c6e-ae28-94630d0ee829","resolution":{"observed_at":"2026-08-07T11:20:30.253352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.256232Z","title":"A weak puf-assisted strong PUF with inherent immunity to modeling attacks and ultra-low BER.IEEE Trans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.256232Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:10195a4931829a76388eebbf2e3238dcfe74626f96735963a2c58701d0fb5d08","observation_id":"059d0a55-a48b-492c-88cb-8aece664d9b8","resolution":{"observed_at":"2026-08-07T11:20:30.256232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.259016Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing.ACM Comput","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.259016Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:a89e01a693314d7f6c8a04da44357b174e243f503b90a2c2d10e50a29aebc07b","observation_id":"40c8c989-53c6-4d68-8751-493ecdc5f901","resolution":{"observed_at":"2026-08-07T11:20:30.259016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05821","last_updated":"2025-04-09T10:23:39Z","snapshot_observed_at":"2026-08-16T14:11:24.750510Z","submitted_at":"2024-03-09T07:01:44Z","title":"Optimizing LLM Queries in Relational Data Analytics Workloads","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05821","snapshot_observed_at":"2026-08-07T11:20:30.261857Z","title":"Optimizing llm queries in relational work- loads.arXiv preprint arXiv:2403.05821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.261857Z"},"links":{"cited_paper":"/paper/2403.05821","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:e69d04c0c99b0c67579e1be3dcb43d71480d17021e0153cebc32c600cbdfe583","observation_id":"dc9831d2-69bb-420a-bb53-fa0af3891423","resolution":{"observed_at":"2026-08-07T11:20:30.261857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-18T04:49:12.041312Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-07T11:20:30.265155Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks.CoRR, abs/2110.07602, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.265155Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:453a5a785075517bff2e7f80ac279572695fc122239f8d7d2733cfadcc3d7600","observation_id":"98c13187-fbe6-45f1-a899-603fbd6808fd","resolution":{"observed_at":"2026-08-07T11:20:30.265155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.268065Z","title":"S2ta: Exploiting structured sparsity for energy-efficient mobile cnn acceleration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.268065Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:b46b0af60e9ec93a18bfaf9f8449b99290cc63813bf574b691f29919f8970216","observation_id":"5e8bf18e-2803-44d9-815e-950769ad6970","resolution":{"observed_at":"2026-08-07T11:20:30.268065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.270805Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.270805Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:9bb6d43cc50dd16b4e11141f9dc4a0b7c0d3880b650ac61b4eabf259facf982d","observation_id":"cc06d880-bfde-4b77-a791-4d4d3dfe2413","resolution":{"observed_at":"2026-08-07T11:20:30.270805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.273473Z","title":"Prediction-guided performance-energy trade-off for in- teractive applications","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.273473Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f2bcae481f0945c71b055bc59b4d05209dd665a1a7de4c67ea59f862bdda1a4e","observation_id":"1de46390-2a91-4b0f-b3cf-42d3ec200c22","resolution":{"observed_at":"2026-08-07T11:20:30.273473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.276218Z","title":"Marcus, Beatrice Santorini, and Mary Ann Marcinkiewicz","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.276218Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:2db96b9b197d0c7dd008f3b2f7e84231e4acfcb8a5e086df73529c94c297fe39","observation_id":"7497c9fe-741d-4040-8bf4-82b39c4554a3","resolution":{"observed_at":"2026-08-07T11:20:30.276218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-16T14:12:14.696997Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-07T11:20:30.278863Z","title":"Shortgpt: Layers in large language mod- els are more redundant than you expect.CoRR, abs/2403.03853, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.278863Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:794764dedd0305d4d06489e34d1c5642c0183a356cc445dc73ac3436047286a5","observation_id":"c914c224-035c-4e1c-aa41-954e5254ae86","resolution":{"observed_at":"2026-08-07T11:20:30.278863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:30.281679Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.281679Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:3bafd1ca722d8ca31397de18831293211c74faecd44ac62dbaa2838d1f8f4fe1","observation_id":"79bf636c-b388-40a6-b286-26ac92fe6ea4","resolution":{"observed_at":"2026-08-07T11:20:30.281679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T11:20:30.284503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.284503Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:dfd80342271593a006df575c469a443f0948e82d3eee942ce1bf2ccaf092a1b1","observation_id":"b9c2c25e-8a62-44d0-b1a0-e89445234836","resolution":{"observed_at":"2026-08-07T11:20:30.284503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:31.571340Z","title":"Your Everyday AI Companion | Microsoft Bing.https://www.bing.com/new","venue":null,"work_id":"8c2a36b2-3937-4c32-b5c1-2906640fcf8a","year":null},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.287740Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:75bb61fac10fa547e4a68711a7b8d6fcf2e5e447e864d715d17769dfedb2f624","observation_id":"83756a73-5010-41ed-8ba1-e7deb2c5c203","resolution":{"observed_at":"2026-08-07T11:20:31.575245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:31.561004Z","title":"Azure cognitive services - text analytics: Smart reply, 2024","venue":null,"work_id":"ea1c2c07-5ddc-4b92-b14a-7965a2b348d2","year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.290561Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:e6ff564a3e9d8e254d05de0de175bfc7f1f1712b4ca20ab5ac8ac4fab86fcb9e","observation_id":"3d61d069-39b8-4c12-9e0e-9c70e9469066","resolution":{"observed_at":"2026-08-07T11:20:31.564613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:31.550457Z","title":"Deepspeed: Advancing the science of ai through efficient training of large models, 2024","venue":null,"work_id":"b4771921-8897-416d-b7c7-087d9ae9a73a","year":2024},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.293309Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:f94a39f67447658da053dc9ede111ac8d4b4457d31cc343288d747aa03d1f9ea","observation_id":"9c879a7c-19b0-46e7-b8b8-44270946c878","resolution":{"observed_at":"2026-08-07T11:20:31.554368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:31.539360Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":"2400f211-bc8b-4cfb-8624-85b5c7e74e3f","year":2018},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.296304Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:dc5eb36694a492b68b4afb7841743052e82444090542db2f07b5d8ab415dd983","observation_id":"2072150f-84ce-4f0b-a638-25af384b7116","resolution":{"observed_at":"2026-08-07T11:20:31.543370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:31.526779Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529– 533, 2015","venue":null,"work_id":"6d262d86-d1fc-447e-8538-0b16afdae98c","year":2015},"citing_paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:30.299592Z"},"links":{"citing_paper":"/paper/2506.02847"},"observation_digest":"sha256:7793ddf33528b0feac5cf4d8012c0eaeaf134c76da607726da942ba4448bac74","observation_id":"c896b732-803f-40d2-8d70-e7656d596dcb","resolution":{"observed_at":"2026-08-07T11:20:31.531742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02847","last_updated":"2025-06-03T13:16:00Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-17T18:18:03.108087Z","submitted_at":"2025-06-03T13:16:00Z","title":"CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":162},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 162 outbound references and 1 inbound Pith citation observation for arXiv:2506.02847."}