{"as_of":"2026-08-07T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35234c28aa4466d867cd612d6f6ddca4c213a774733225a7c7f8a9aa109f6fa2","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:56:57.070193Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:34:25.790205Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-04T19:34:25.790205Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09193","last_updated":"2025-09-11T07:09:30Z","snapshot_observed_at":"2026-08-07T07:37:18.552922Z","submitted_at":"2025-09-11T07:09:30Z","title":"AI Reasoning for Wireless Communications and Networking: A Survey and Perspectives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:34:25.790205Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2509.09193"},"observation_digest":"sha256:5b23505091eded3961aca2349f75743fc26e7c409ae97b81115300aa39dbe483","observation_id":"51c91ec7-75e7-407b-bacb-1972153792d3","resolution":{"observed_at":"2026-08-04T19:34:25.790205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2605.01111","last_updated":"2026-05-01T21:31:59Z","snapshot_observed_at":"2026-07-06T23:14:24.758147Z","submitted_at":"2026-05-01T21:31:59Z","title":"When Less is Enough: Efficient Inference via Collaborative Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:04.267404Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2605.01111"},"observation_digest":"sha256:d6032450572044eb3369da8ad6abd5cad80a00656fc539534f7462ed5f5cb728","observation_id":"744745d6-6957-4b28-bb15-51ab1b51eaec","resolution":{"observed_at":"2026-05-11T15:41:42.531986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2605.11317","last_updated":"2026-05-11T23:07:33Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-11T23:07:33Z","title":"SOMA: Efficient Multi-turn LLM Serving via Small Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:37:27.361504Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2605.11317"},"observation_digest":"sha256:0efd498ffe44c669f56c4f503c493ce0b4b04a89689447516973f6d605ece233","observation_id":"34674ce5-e34d-40c4-97ff-f856eab0a7c5","resolution":{"observed_at":"2026-05-13T01:42:04.221906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2606.06840","last_updated":"2026-06-05T02:32:24Z","snapshot_observed_at":"2026-08-05T15:03:33.373071Z","submitted_at":"2026-06-05T02:32:24Z","title":"Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-27T22:22:52.690010Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2606.06840"},"observation_digest":"sha256:caba6f932cb8490735a1a20918d6514bccd03e8a0c8e11913303540e4f823296","observation_id":"4f495410-efb5-4926-87f1-8dcf3557bdb5","resolution":{"observed_at":"2026-06-27T22:31:21.605739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"cited_work":{"arxiv_id":"2506.06579","doi":"10.48550/arxiv.2506.06579","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards efficient multi-llm inference: Characterization and analysis of llm routing and hierarchical techniques","venue":"ArXiv.org","work_id":"aa68a473-69c6-46c7-b732-df1a11a89102","year":2025},"citing_paper":{"arxiv_id":"2606.06924","last_updated":"2026-06-05T05:42:00Z","snapshot_observed_at":"2026-08-06T11:49:12.989321Z","submitted_at":"2026-06-05T05:42:00Z","title":"From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-06-27T22:54:28.452796Z"},"links":{"cited_paper":"/paper/2506.06579","citing_paper":"/paper/2606.06924"},"observation_digest":"sha256:b009ec6c8eb7c283f407ead1c5c7ec8ce92211e98a1e252d153889180f557b18","observation_id":"4fbda2fd-a0ef-45e3-b4ae-6be656850ee8","resolution":{"observed_at":"2026-07-02T16:17:08.806454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06579/citation-record","integrity":"/paper/2506.06579/integrity","json":"/paper/2506.06579/citation-record.json","paper":"/paper/2506.06579"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T05:56:56.676293Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.676293Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:fac9ed3aad9209ab3a9b84ba072ed23fa5ffc28fc28e65a9c78e941b7951a05e","observation_id":"18d0f5d8-50b3-4731-9b87-671596bc7b41","resolution":{"observed_at":"2026-08-07T05:56:56.676293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.681421Z","title":"Gpt-3: What is it good for,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.681421Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:cc4a23f401af7282903427e8b3f319e70d636482dc616f895019d14c4eb4e148","observation_id":"81b4d2ff-f2a3-422a-9949-b79583aae3c4","resolution":{"observed_at":"2026-08-07T05:56:56.681421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T05:56:56.685256Z","title":"Deepseek llm: Scaling open-source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.685256Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e0ec10005b8008d720243bd337ee62403bf68f728e790d9d8ba52a0e2fa043ed","observation_id":"05ee312a-aeb1-4c58-afe7-62044f8759ee","resolution":{"observed_at":"2026-08-07T05:56:56.685256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18921","last_updated":"2025-03-20T05:23:42Z","snapshot_observed_at":"2026-07-06T18:52:34.247456Z","submitted_at":"2024-07-09T13:47:05Z","title":"Mobile Edge Intelligence for Large Language Models: A Contemporary Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18921","snapshot_observed_at":"2026-08-07T05:56:56.689467Z","title":"Mobile edge intelligence for large language models: A contemporary survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.689467Z"},"links":{"cited_paper":"/paper/2407.18921","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:64ded98bd351dc45aeab07d72096ec6b5a9a7b24c661acbfe8549447582c42a9","observation_id":"b3796b1a-f0bc-4e92-a908-bdbe0898d0e7","resolution":{"observed_at":"2026-08-07T05:56:56.689467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01799","last_updated":"2024-04-24T04:58:46Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T06:29:34Z","title":"Faster and Lighter LLMs: A Survey on Current Challenges and Way Forward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01799","snapshot_observed_at":"2026-08-07T05:56:56.693866Z","title":"Faster and lighter llms: A survey on current challenges and way forward,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.693866Z"},"links":{"cited_paper":"/paper/2402.01799","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:2a9c2b925f9942024859e74249bed6f03f8929c86c9a9a71c897a8ab79ff9c83","observation_id":"46ff31e9-dd1b-46b2-96a3-52481f9c4c92","resolution":{"observed_at":"2026-08-07T05:56:56.693866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08092","last_updated":"2024-09-23T07:37:34Z","snapshot_observed_at":"2026-08-04T14:53:28.652029Z","submitted_at":"2024-01-16T03:35:26Z","title":"A Survey of Resource-efficient LLM and Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08092","snapshot_observed_at":"2026-08-07T05:56:56.698136Z","title":"A survey of resource-efficient llm and mul- timodal foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.698136Z"},"links":{"cited_paper":"/paper/2401.08092","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:be673079ca17172d90312cfcc6d03dbb34bd960b15c8def5179e2184a065459d","observation_id":"33ce2435-327e-49b8-953f-09acee7540f3","resolution":{"observed_at":"2026-08-07T05:56:56.698136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.703061Z","title":"Efficient compressing and tuning methods for large language models: A systematic literature review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.703061Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6eb6a5ccff0fa3a133ce37f3d3244f453f895a4de8afa22c67b86ad0dbfac2f0","observation_id":"9fab6bad-1562-4300-b2ef-c1200ed5900d","resolution":{"observed_at":"2026-08-07T05:56:56.703061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T05:56:56.706799Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.706799Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c600b42c3e148180b459d07afb393241f06fa30c7f4a8157906184584f50ec1f","observation_id":"61647dc1-bbbe-496c-bfb1-6c23b4989b34","resolution":{"observed_at":"2026-08-07T05:56:56.706799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.08764","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.782657Z","title":"Evaluation of the phi-3-mini slm for identification of texts related to medicine, health, and sports injuries,","venue":null,"work_id":"c903c324-775b-41f9-b3cc-972e91c8cfe8","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.710904Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8fba869f29a94cc81a8dc76bbc8cbaeb6d57417e4f9a3e383d710cbd5686f039","observation_id":"3e1f6fc4-ce73-4bd6-988b-01bc1c177bbd","resolution":{"observed_at":"2026-08-07T05:56:57.788517Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.714951Z","title":"Harnessing moderate- sized language models for reliable patient data deidentification in emergency department records: Algorithm development, validation, and implementation study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.714951Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:bb2c2b37349ea081d80179a9a297aea80ac402a36344ce71bfe7f3285cc7ce7e","observation_id":"e5184609-c34b-4f89-b9d8-454290dbc810","resolution":{"observed_at":"2026-08-07T05:56:56.714951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.718751Z","title":"Overview of small language models in practice,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.718751Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:a9943f6f5aac5d49d423e3ac6cf134e0efcade3634f72e4578faa92bb086741e","observation_id":"ef61aed4-6660-40d4-a88f-3ed439004692","resolution":{"observed_at":"2026-08-07T05:56:56.718751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10834","last_updated":"2025-04-22T03:55:14Z","snapshot_observed_at":"2026-08-02T06:57:44.337097Z","submitted_at":"2024-07-15T15:45:07Z","title":"MetaLLM: A High-performant and Cost-efficient Dynamic Framework for Wrapping LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10834","snapshot_observed_at":"2026-08-07T05:56:56.722420Z","title":"Metallm: A high-performant and cost- efficient dynamic framework for wrapping llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.722420Z"},"links":{"cited_paper":"/paper/2407.10834","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:20cc4b59560856e99913000a1cd4dad13b5f7206b4d2e9eb393d69dc117bccbd","observation_id":"25ca84e2-fe07-4ddb-9284-b90423a8e8de","resolution":{"observed_at":"2026-08-07T05:56:56.722420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03046","last_updated":"2023-10-03T22:16:13Z","snapshot_observed_at":"2026-07-06T16:27:51.438846Z","submitted_at":"2023-10-03T22:16:13Z","title":"EcoAssistant: Using LLM Assistant More Affordably and Accurately","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03046","snapshot_observed_at":"2026-08-07T05:56:56.726464Z","title":"Ecoassistant: Using llm assistant more affordably and accurately,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.726464Z"},"links":{"cited_paper":"/paper/2310.03046","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:639c889c30e3dc1618438a4b7c3bab7090d5068d65715b8e7a5ce6afa2c737cc","observation_id":"5cf3d3c2-0771-478c-a869-9735cf428956","resolution":{"observed_at":"2026-08-07T05:56:56.726464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-07T05:56:56.730282Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.730282Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:34ff2f7e6a985723b5fe02e2205b9063ed411806372df06b9acee02ee86b93f3","observation_id":"ebb02bfe-3add-451a-adfe-b3185ef308e7","resolution":{"observed_at":"2026-08-07T05:56:56.730282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00467","last_updated":"2024-05-01T12:04:28Z","snapshot_observed_at":"2026-08-03T15:18:25.179746Z","submitted_at":"2024-05-01T12:04:28Z","title":"Harnessing the Power of Multiple Minds: Lessons Learned from LLM Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00467","snapshot_observed_at":"2026-08-07T05:56:56.734663Z","title":"Harnessing the power of multiple minds: Lessons learned from llm routing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.734663Z"},"links":{"cited_paper":"/paper/2405.00467","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c8ebed5e317a7c8d4c2c053a045e7c461dbcd419f38624a6ddd6544c8f091a4b","observation_id":"1adff952-db0e-4c63-9f30-5560021ae50e","resolution":{"observed_at":"2026-08-07T05:56:56.734663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08692","last_updated":"2023-11-15T04:40:43Z","snapshot_observed_at":"2026-07-06T16:47:45.504109Z","submitted_at":"2023-11-15T04:40:43Z","title":"Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08692","snapshot_observed_at":"2026-08-07T05:56:56.738323Z","title":"Routing to the expert: Efficient reward-guided ensemble of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.738323Z"},"links":{"cited_paper":"/paper/2311.08692","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:49b69fe1c9217d54895990b32f4f7b7b70ff4680018c7961f40f7ddd33b2b6af","observation_id":"c53fac9d-a16e-49b1-9c65-099db0fc7b9b","resolution":{"observed_at":"2026-08-07T05:56:56.738323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10657","last_updated":"2025-05-20T14:59:21Z","snapshot_observed_at":"2026-08-06T09:29:44.410317Z","submitted_at":"2025-03-08T04:07:07Z","title":"RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10657","snapshot_observed_at":"2026-08-07T05:56:56.742261Z","title":"Routereval: A comprehensive benchmark for routing llms to explore model-level scaling up in llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.742261Z"},"links":{"cited_paper":"/paper/2503.10657","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:f33976b504c93c67360ae7a2208a23d03ccd3df0f6192b527ba2bdcb73e18a1e","observation_id":"e13a777d-61db-46c8-bd3e-3388bac034aa","resolution":{"observed_at":"2026-08-07T05:56:56.742261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12031","last_updated":"2024-03-28T17:56:28Z","snapshot_observed_at":"2026-07-06T17:46:29.153377Z","submitted_at":"2024-03-18T17:59:04Z","title":"RouterBench: A Benchmark for Multi-LLM Routing System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12031","snapshot_observed_at":"2026-08-07T05:56:56.746355Z","title":"Routerbench: A benchmark for multi-llm routing system,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.746355Z"},"links":{"cited_paper":"/paper/2403.12031","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:9d1b7482c42d514d4125b092404dd4ad4ba75413031ab0456fe0046c88d0aa5a","observation_id":"109d4bb6-2963-4afc-a98d-8f293c457236","resolution":{"observed_at":"2026-08-07T05:56:56.746355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-07T05:56:56.750392Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.750392Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3a8365c2d4a5e3ae5235ab336e7218dd4df8988634b88e686be7ad646228a8ce","observation_id":"e14414f2-d12c-4f9d-85c1-466be764662a","resolution":{"observed_at":"2026-08-07T05:56:56.750392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00625","last_updated":"2024-12-29T17:38:32Z","snapshot_observed_at":"2026-08-03T07:09:22.905094Z","submitted_at":"2024-01-01T01:12:42Z","title":"Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00625","snapshot_observed_at":"2026-08-07T05:56:56.754256Z","title":"Beyond efficiency: A systematic survey of resource-efficient large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.754256Z"},"links":{"cited_paper":"/paper/2401.00625","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8696fc2e18cb268c6fe04a9fba6a4a4300d722b193f655dac3004d667550fc45","observation_id":"5e8ed8fa-1544-40d7-b95d-3d65bd8a07dd","resolution":{"observed_at":"2026-08-07T05:56:56.754256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20306","last_updated":"2024-03-29T17:22:48Z","snapshot_observed_at":"2026-07-06T17:53:11.000124Z","submitted_at":"2024-03-29T17:22:48Z","title":"Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20306","snapshot_observed_at":"2026-08-07T05:56:56.758394Z","title":"To- wards greener llms: Bringing energy-efficiency to the forefront of llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.758394Z"},"links":{"cited_paper":"/paper/2403.20306","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:42721ca81ffea1605d06ebebad8c8b96a28f8a6c30e9f2ab795f335ce4d0428b","observation_id":"0c823151-99af-4d27-9d87-0b6c60cb9593","resolution":{"observed_at":"2026-08-07T05:56:56.758394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12391","last_updated":"2024-07-17T08:11:47Z","snapshot_observed_at":"2026-07-06T18:47:37.971415Z","submitted_at":"2024-07-17T08:11:47Z","title":"LLM Inference Serving: Survey of Recent Advances and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12391","snapshot_observed_at":"2026-08-07T05:56:56.762293Z","title":"Llm inference serv- ing: Survey of recent advances and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.762293Z"},"links":{"cited_paper":"/paper/2407.12391","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e1b9409875ea391720f86b88eaeb0a8d4ab8f7bdc139aedf1cb76e72ea65d57a","observation_id":"23b5ca1b-7de2-48db-b85d-84b7783cced2","resolution":{"observed_at":"2026-08-07T05:56:56.762293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15234","last_updated":"2025-07-23T10:11:55Z","snapshot_observed_at":"2026-08-05T06:23:34.302204Z","submitted_at":"2023-12-23T11:57:53Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15234","snapshot_observed_at":"2026-08-07T05:56:56.766216Z","title":"Towards efficient generative large language model serving: A survey from algorithms to systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.766216Z"},"links":{"cited_paper":"/paper/2312.15234","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:bf56eb565b045484000883db5b620d1a87073f976937af52f15ff5ef465afdc2","observation_id":"8a93df01-9df9-49f3-a6fd-8babc8be4a46","resolution":{"observed_at":"2026-08-07T05:56:56.766216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T05:56:56.770100Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.770100Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8a5592e4636882000f354c7683283488755a5ff9b6c896d6dae70f4f1f4ad524","observation_id":"1d8ad172-a5ce-46a3-ad55-399e14c4ea5e","resolution":{"observed_at":"2026-08-07T05:56:56.770100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00678","last_updated":"2024-04-18T18:10:28Z","snapshot_observed_at":"2026-08-02T09:37:08.520958Z","submitted_at":"2023-12-01T16:00:25Z","title":"The Efficiency Spectrum of Large Language Models: An Algorithmic Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00678","snapshot_observed_at":"2026-08-07T05:56:56.774041Z","title":"The efficiency spectrum of large language models: An algorithmic survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.774041Z"},"links":{"cited_paper":"/paper/2312.00678","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ed8d10507b101d7523cb3c11434f7f340ac547a845276af4a28052f06325ed43","observation_id":"5a9e363e-7f67-4f63-9e44-a51864a34603","resolution":{"observed_at":"2026-08-07T05:56:56.774041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18036","last_updated":"2026-04-22T02:19:48Z","snapshot_observed_at":"2026-08-02T22:41:05.099083Z","submitted_at":"2025-02-25T09:48:53Z","title":"Harnessing Multiple Large Language Models: A Survey on LLM Ensemble","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18036","snapshot_observed_at":"2026-08-07T05:56:56.778198Z","title":"Harnessing multiple large language models: A survey on llm ensemble,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.778198Z"},"links":{"cited_paper":"/paper/2502.18036","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3ffe405dde03377d4950b9fe4843dd879435fb9a1d54763c9ee92c87d773a28d","observation_id":"eb037d63-9b43-4127-a192-d9fc29db83ea","resolution":{"observed_at":"2026-08-07T05:56:56.778198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07460","last_updated":"2025-05-12T11:48:42Z","snapshot_observed_at":"2026-08-07T15:47:54.514869Z","submitted_at":"2025-05-12T11:48:42Z","title":"A Survey on Collaborative Mechanisms Between Large and Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07460","snapshot_observed_at":"2026-08-07T05:56:56.786194Z","title":"A survey on collaborative mech- anisms between large and small language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.786194Z"},"links":{"cited_paper":"/paper/2505.07460","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:1a2ca3f41ed081a75737ca9297f9952f15de3509913ad25d7d881910a30d19ff","observation_id":"6039e81e-d05b-4f0a-ae3f-a52ab2991376","resolution":{"observed_at":"2026-08-07T05:56:56.786194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-04T15:12:57.585393Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T05:56:56.789923Z","title":"A survey on mixture of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.789923Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:fadf09a5e65409b2ba894c1c7103f83474958307adfad96b5bd04f9b6d018642","observation_id":"5de78550-fd1b-4748-9cb0-1c7e64efeb56","resolution":{"observed_at":"2026-08-07T05:56:56.789923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.793800Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.793800Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:63b3f2edc43046c13fdd526ab739d80f6d5874f6f1e8f302f1fd7f8cd5c5e290","observation_id":"3577678f-29a4-4934-b91a-f0345d91bd84","resolution":{"observed_at":"2026-08-07T05:56:56.793800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.797365Z","title":"Improving text classification with transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.797365Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:0bddd35c85df29f3490b2df9fdb4f658a5ca00e337bd795df00b0835001b0f47","observation_id":"0bbbec51-4dd0-4c8b-a035-89a8f7eb3720","resolution":{"observed_at":"2026-08-07T05:56:56.797365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00187","last_updated":"2018-09-04T23:19:27Z","snapshot_observed_at":"2026-07-06T06:42:25.746932Z","submitted_at":"2018-06-01T04:33:16Z","title":"Scaling Neural Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00187","snapshot_observed_at":"2026-08-07T05:56:56.800726Z","title":"Scaling neural machine translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.800726Z"},"links":{"cited_paper":"/paper/1806.00187","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ec474b3efd5433c087a202df4b387c9b653372f5bfdc1078ec9fe7c203144319","observation_id":"978ff6f8-5e7e-437d-be5b-5011412a4460","resolution":{"observed_at":"2026-08-07T05:56:56.800726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.804693Z","title":"Block-skim: Efficient question answering for transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.804693Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:9dc9d15da1e334a255c54b4df8e05df2779b0a42100da795ce8d6af55db2ed06","observation_id":"be4655b7-aea5-4364-b2f2-dd5ae28b5a34","resolution":{"observed_at":"2026-08-07T05:56:56.804693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.808452Z","title":"An attentive survey of attention models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.808452Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:6d0bd97ef8ef891818cfd9b42c73a958dcdebee0481ae9db29c2ea8e7460679c","observation_id":"b2660a75-897a-4d33-bb3f-35ccf3443b7f","resolution":{"observed_at":"2026-08-07T05:56:56.808452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.811824Z","title":"Attention, please! a survey of neural attention models in deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.811824Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:54a45f5a5a776799b0650b495a3db9af9f645f78aca2cd37d91cb5b8d89dee61","observation_id":"c6c1e688-a417-42a8-b552-c22a9386b9f3","resolution":{"observed_at":"2026-08-07T05:56:56.811824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.815532Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.815532Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3f5ba6e3d6bc928af954992b5c361f5acb2dc081144aedb96375546b55c8ea79","observation_id":"6710cb2b-7a60-47f6-bbc8-cc316fb1a6b0","resolution":{"observed_at":"2026-08-07T05:56:56.815532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.819461Z","title":"Deep learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.819461Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:587aa88e4994f716e5cba953be5232d69258ec3f453cf6e1cb0b6e4cc5df1782","observation_id":"3ae31ecd-3f5e-4c04-b5b3-662fbbc0d25d","resolution":{"observed_at":"2026-08-07T05:56:56.819461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.823248Z","title":"Deep learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.823248Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:bca6a8ab35e182582edb4345a0a1d967cdb0d8e1da56d689bf82f4fb1ea5a914","observation_id":"19dd7d3c-cf54-4f03-9153-8cece3bdd3da","resolution":{"observed_at":"2026-08-07T05:56:56.823248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.827223Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.827223Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:07ecbe9bf0b1275e8fab7044124163e0813172a60d2aea9835762aa2512481c6","observation_id":"ed2ed15a-de27-4b25-a446-5ba96e48fe8b","resolution":{"observed_at":"2026-08-07T05:56:56.827223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-03T08:52:05.725675Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-07T05:56:56.830717Z","title":"Towards expert- level medical question answering with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.830717Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c8ca7941f1d6aa23a9d7cac2bd0828e0c09621a7ce9eeb1f8fbb8b6d3e994e1a","observation_id":"91a31ed1-48ed-4645-aca7-f84d249d3ae8","resolution":{"observed_at":"2026-08-07T05:56:56.830717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.834768Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.834768Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8e2a824019f597a9a6c2e9f71940c795a4c3817a97b29fe474b9024196eeb601","observation_id":"61ad6437-42e6-421f-a37d-6989b2f3066d","resolution":{"observed_at":"2026-08-07T05:56:56.834768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00952","last_updated":"2024-07-01T04:13:25Z","snapshot_observed_at":"2026-08-06T08:29:51.313033Z","submitted_at":"2024-07-01T04:13:25Z","title":"SplitLoRA: A Split Parameter-Efficient Fine-Tuning Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00952","snapshot_observed_at":"2026-08-07T05:56:56.838942Z","title":"Splitlora: A split parameter-efficient fine-tuning framework for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.838942Z"},"links":{"cited_paper":"/paper/2407.00952","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e66cea60f30a1da93f41a7f97d0f4dbc8eceaf491b0bb48051ae122b1e009711","observation_id":"026b1338-c47b-486d-8f6f-1b19e7c41a99","resolution":{"observed_at":"2026-08-07T05:56:56.838942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-07T05:56:56.843455Z","title":"Albert: A lite bert for self-supervised learning of language representations,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.843455Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ed66124e02891a7be62bf22f6ab2b465f8ff3e3361df9ab27b45250c8891d6bf","observation_id":"17d69191-bd0e-4a14-bc3c-c4a18dc13238","resolution":{"observed_at":"2026-08-07T05:56:56.843455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.847663Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.847663Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:55bf84bb3b76e15b7a373baf6236f427f51512d97186bff12705d78afe076b22","observation_id":"022ef8eb-2881-47dd-8cf3-a1b946ccdd12","resolution":{"observed_at":"2026-08-07T05:56:56.847663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.851308Z","title":"Gpt-4 is here: what scientists think,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.851308Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c9a937590df9240ea043aaaccf6019f72509b694f993525da98cce36a5789a72","observation_id":"f37dcbe8-5666-47ea-9135-c094306895a8","resolution":{"observed_at":"2026-08-07T05:56:56.851308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.854998Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.854998Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:06a4a74ea28d18747d0387d991bd23593ef3957b80abdaeaea50256377f5e1ff","observation_id":"7d9c7891-7d51-4166-a825-b38212f263f3","resolution":{"observed_at":"2026-08-07T05:56:56.854998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.858659Z","title":"Multimodal deep learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.858659Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:295ca36878e7ddab6e85c24df3860d51b831aa6ba4046985ae1d65dc9c3fc685","observation_id":"5296042b-7465-4dcb-acdb-81f0fe42a09e","resolution":{"observed_at":"2026-08-07T05:56:56.858659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.862350Z","title":"Multimodal machine learning: A survey and taxonomy,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.862350Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e12e597bfad964108300e791c963174d439b5d8dec249b0578457ab83e004a7f","observation_id":"22078948-1812-47f7-aa95-707bf650affd","resolution":{"observed_at":"2026-08-07T05:56:56.862350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.866015Z","title":"Multimodal transformer for unaligned multimodal language sequences,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.866015Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:384cb5971e5994c24f5386b3367f372ef4380169aa743138041942fa73ddfc6e","observation_id":"81b85cd3-5be3-4683-a409-c9a9637d77f2","resolution":{"observed_at":"2026-08-07T05:56:56.866015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:56:56.869757Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.869757Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ead646559f0b2f63943e207ec25a168d49aedd0e11161d043c988635d73680ea","observation_id":"c9922b25-8d4c-44a1-a3b3-5ced6bfeb68f","resolution":{"observed_at":"2026-08-07T05:56:56.869757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.873536Z","title":"Crossner: Evaluating cross-domain named entity recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.873536Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:64ad9bbd997485183294d13ff81f23e55df751f15666b70ea40dfe6c19c57699","observation_id":"afed7e32-5d07-4dbe-837e-0300bfc2d845","resolution":{"observed_at":"2026-08-07T05:56:56.873536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.877137Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.877137Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:b9b479891d84ed331674f3f8b93ccc4482ed98223d3c6f486042cc864925ead9","observation_id":"770a5b30-5cab-4377-97c3-9a1bac24c3d7","resolution":{"observed_at":"2026-08-07T05:56:56.877137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T05:56:56.880936Z","title":"On the opportunities and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.880936Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e9227ea6de681e0d4defef47f14321b936183f20b0311f90d20d0c8c8c82551a","observation_id":"087f0a8a-8a25-44d6-bc85-4db173ac2277","resolution":{"observed_at":"2026-08-07T05:56:56.880936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.885110Z","title":"Xtext language engineering for everyone,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.885110Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8d91a499825a1fff52c132c0432d69729613e07ffc365db20bb7265dccfe65c9","observation_id":"bade9839-b308-4cfe-bf10-2a8dc2d847d5","resolution":{"observed_at":"2026-08-07T05:56:56.885110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.888633Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.888633Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:61e7b916f14c244d721cb0c985adcfa19cf3f24a70675b8de13bf3713bdbe0b4","observation_id":"ec150ed6-967c-40c8-a0fa-2959ee49851e","resolution":{"observed_at":"2026-08-07T05:56:56.888633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.892388Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.892388Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:0e6998e5edea86b7876d03240f49f141a0941fb66054ea1ddf8baf8099610fa4","observation_id":"1a5c4180-e441-4f2a-9a48-1367d5f4289d","resolution":{"observed_at":"2026-08-07T05:56:56.892388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-02T12:55:25.835610Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T05:56:56.896718Z","title":"Hymba: A hybrid-head architecture for small language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.896718Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:94249408070e145f2a8d0dddcae44885c70d2c32bf49a89a768268f3d73899bd","observation_id":"3b22685c-af14-40c0-8907-133b90e7a683","resolution":{"observed_at":"2026-08-07T05:56:56.896718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03350","last_updated":"2024-12-28T09:18:36Z","snapshot_observed_at":"2026-08-04T03:34:32.259687Z","submitted_at":"2024-11-04T04:43:01Z","title":"A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03350","snapshot_observed_at":"2026-08-07T05:56:56.900912Z","title":"A comprehensive survey of small language models in the era of large language models: Techniques, en- hancements, applications, collaboration with llms, and trustworthiness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.900912Z"},"links":{"cited_paper":"/paper/2411.03350","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:eb3e36617c711d59a0016e9bd3f341aa73dcb22ed812c492a0c53205b2071050","observation_id":"b3a4de7e-c2fd-4b95-a2d4-19d0257026f4","resolution":{"observed_at":"2026-08-07T05:56:56.900912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15790","last_updated":"2025-02-26T06:34:55Z","snapshot_observed_at":"2026-08-04T07:43:40.230682Z","submitted_at":"2024-09-24T06:36:56Z","title":"Small Language Models: Survey, Measurements, and Insights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15790","snapshot_observed_at":"2026-08-07T05:56:56.904953Z","title":"Small language models: Survey, measurements, and insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.904953Z"},"links":{"cited_paper":"/paper/2409.15790","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d57d6531261592e2cb4084b14615e6ef60095bb6a91ec28e432e1424c0aa2992","observation_id":"b66c68af-5e7d-4b6a-b49d-f98e1538b848","resolution":{"observed_at":"2026-08-07T05:56:56.904953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-07T05:56:56.908957Z","title":"Hallucination is inevitable: An innate limitation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.908957Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:a4297bc5c01642c521263a0361c04235d4aa408921d83814cec8319fc362916d","observation_id":"ec4eb572-b1a4-4129-b4ec-aee6e84b0c0c","resolution":{"observed_at":"2026-08-07T05:56:56.908957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.070334Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":"d8105bc3-efbc-4fdd-8fba-8f0d5a8ade97","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.912852Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:a8d4050020af140acc71181de7afe695b74a9d035e10eb93a5fd7270bba5b783","observation_id":"d1c0e700-7c5e-4bb3-ad41-ee82a0f844d6","resolution":{"observed_at":"2026-08-07T05:56:58.074869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.057815Z","title":"Towards trustworthy llms: a review on debiasing and dehallucinating in large language models,","venue":null,"work_id":"81794935-b3ac-4a9e-b196-0d251101819c","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.916756Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:52eee3207d64f3ab4d30f7b16f95fab8ce092fd0f0c620047543a13d78a46fa6","observation_id":"0edc626f-8814-43c8-b43b-70c8fc73aec6","resolution":{"observed_at":"2026-08-07T05:56:58.062327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.920457Z","title":"Sometimes painful but certainly promising: Feasibility and trade-offs of language model inference at the edge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.920457Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:45e09757c2fde743b62c106be862b0999d3a13504c23e60dd2f858f509309799","observation_id":"c7ad77f5-909c-45ae-9d6b-93fce6f8cad5","resolution":{"observed_at":"2026-08-07T05:56:56.920457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11601","last_updated":"2023-08-23T17:34:17Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:48:24Z","title":"Tryage: Real-time, intelligent Routing of User Prompts to Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11601","snapshot_observed_at":"2026-08-07T05:56:56.924187Z","title":"Tryage: Real-time, intelligent rout- ing of user prompts to large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.924187Z"},"links":{"cited_paper":"/paper/2308.11601","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:9bc785e9c207eaa036a3227e735b86cda7a3aaee7e009110aaf109313aa10ec1","observation_id":"5b153ab8-f3a6-4034-be29-cb7af28c0ff2","resolution":{"observed_at":"2026-08-07T05:56:56.924187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.046800Z","title":"Fly-swat or cannon? cost- effective language model choice via meta-modeling,","venue":null,"work_id":"44dea3af-60d0-41af-8312-eef6162df9b2","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.928196Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d516acf0d1b6efc9ee37bc5c999cf8435d3d97688087a572de475ec00868bb57","observation_id":"2763b83c-da63-41cd-9755-02619710b949","resolution":{"observed_at":"2026-08-07T05:56:58.050512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13979","last_updated":"2024-10-02T08:51:45Z","snapshot_observed_at":"2026-08-02T08:13:53.554753Z","submitted_at":"2024-01-25T06:45:32Z","title":"Routoo: Learning to Route to Large Language Models Effectively","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13979","snapshot_observed_at":"2026-08-07T05:56:56.932292Z","title":"Leeroo orchestrator: Elevating llms performance through model integration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.932292Z"},"links":{"cited_paper":"/paper/2401.13979","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:57803b0405b55a37f37fa108a5242e356ea7efc524a70250f7f41801aec9b09d","observation_id":"3eb1df40-ec5d-4c25-9ffe-fb80b44b4a74","resolution":{"observed_at":"2026-08-07T05:56:56.932292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14618","last_updated":"2024-04-22T23:06:42Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:06:42Z","title":"Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14618","snapshot_observed_at":"2026-08-07T05:56:56.936401Z","title":"Hybrid llm: Cost-efficient and quality-aware query routing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.936401Z"},"links":{"cited_paper":"/paper/2404.14618","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e86161875f43696091547ed5e8e8dc6a79ed88a1b2440035d8828036a15c734b","observation_id":"369e619b-111c-4d37-9083-b7527010f245","resolution":{"observed_at":"2026-08-07T05:56:56.936401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15130","last_updated":"2024-05-24T01:05:37Z","snapshot_observed_at":"2026-08-05T23:59:37.767283Z","submitted_at":"2024-05-24T01:05:37Z","title":"OptLLM: Optimal Assignment of Queries to Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15130","snapshot_observed_at":"2026-08-07T05:56:56.940328Z","title":"Optllm: Optimal assignment of queries to large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.940328Z"},"links":{"cited_paper":"/paper/2405.15130","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d20a3dfaef7455a2726d0398fe5a6b4273724b8917062cc093c10d5ba7008004","observation_id":"df27739d-3704-40bb-8686-deff835a0c54","resolution":{"observed_at":"2026-08-07T05:56:56.940328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.034901Z","title":"Chatgpt,","venue":null,"work_id":"a9f5a268-c1ad-45a8-bbed-098fd99af05c","year":2022},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.944254Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:cff675683bf1b1b7186e8eab1f403a68df30d9399865b343b045b833ccfd616a","observation_id":"0c9c37a1-40eb-474b-8550-5c81a28095c2","resolution":{"observed_at":"2026-08-07T05:56:58.039550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.024338Z","title":"Amazon titan in amazon bedrock,","venue":null,"work_id":"e9ac0d8d-5289-4655-b36f-1d93609c80c4","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.947839Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:45a935f3fbc7e9d1f782075aa069d9613bb2f3d5704ce161ee341886f8dbcba7","observation_id":"42d3dc4a-2a64-41c9-99a2-6b0499547c30","resolution":{"observed_at":"2026-08-07T05:56:58.028097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.013921Z","title":null,"venue":null,"work_id":"10e94fc9-0350-4803-bda9-40274ad733cd","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.951394Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:7154df5cd7c6389d7ab19128776c2be517211026eba79877940b415c90646f75","observation_id":"f221f8e4-7d12-4957-84a7-c3924a8fdfe8","resolution":{"observed_at":"2026-08-07T05:56:58.017464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:58.003772Z","title":null,"venue":null,"work_id":"8b017624-5707-4edd-9ee2-f0443714c365","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.955137Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:3e609e235dda5b325a4ddeb353865f08520ff7ffb7cb5fdb1e64d51a69f0951d","observation_id":"b1854396-ee05-40c7-bc01-4155a4feb7b4","resolution":{"observed_at":"2026-08-07T05:56:58.007120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-07T05:56:56.958761Z","title":"Routellm: Learning to route llms with preference data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.958761Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d2fd1a7654a1913343637a3c73b87679d51a468d78e52cbc8f478332975c74d0","observation_id":"03951d37-536d-408e-baeb-00a54b6df901","resolution":{"observed_at":"2026-08-07T05:56:56.958761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13561","last_updated":"2023-10-20T15:01:55Z","snapshot_observed_at":"2026-08-04T18:27:13.730932Z","submitted_at":"2023-10-20T15:01:55Z","title":"Cache & Distil: Optimising API Calls to Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13561","snapshot_observed_at":"2026-08-07T05:56:56.962993Z","title":"Cache & dis- til: Optimising api calls to large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.962993Z"},"links":{"cited_paper":"/paper/2310.13561","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:5c08f5212622d814189421617223b0bf4e12ac0838799cd3693b71b5cb35dafa","observation_id":"ddbcf273-44eb-4338-99b8-695ce6e04f59","resolution":{"observed_at":"2026-08-07T05:56:56.962993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12963","last_updated":"2025-01-19T15:59:56Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:57:39Z","title":"AutoMix: Automatically Mixing Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12963","snapshot_observed_at":"2026-08-07T05:56:56.966738Z","title":"Automix: Automatically mixing language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.966738Z"},"links":{"cited_paper":"/paper/2310.12963","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:39e245d078361bbcac008065f0ec7fff5c7d4c85c0445b188a3c6489978e0c19","observation_id":"fd6524a2-e721-4cb8-8606-52316e8eb167","resolution":{"observed_at":"2026-08-07T05:56:56.966738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13757","last_updated":"2024-09-15T15:12:45Z","snapshot_observed_at":"2026-07-06T19:18:57.862380Z","submitted_at":"2024-09-15T15:12:45Z","title":"Efficient Hybrid Inference for LLMs: Reward-Based Token Modelling with Selective Cloud Assistance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13757","snapshot_observed_at":"2026-08-07T05:56:56.970762Z","title":"Efficient hybrid inference for llms: Reward- based token modelling with selective cloud assistance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.970762Z"},"links":{"cited_paper":"/paper/2409.13757","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:2c11385e2bde615f191e7b0b10435507af10cd2bfcf79508b10fb265f53cb02b","observation_id":"6547ef9b-67bb-4c49-a87f-454fe5b60ac1","resolution":{"observed_at":"2026-08-07T05:56:56.970762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02134","last_updated":"2024-05-03T14:38:59Z","snapshot_observed_at":"2026-07-31T01:43:43.437617Z","submitted_at":"2024-05-03T14:38:59Z","title":"Optimising Calls to Large Language Models with Uncertainty-Based Two-Tier Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02134","snapshot_observed_at":"2026-08-07T05:56:56.974688Z","title":"Optimising calls to large lan- guage models with uncertainty-based two-tier selection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.974688Z"},"links":{"cited_paper":"/paper/2405.02134","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:290f974cab7483b0fc2fc5ec80f5f8d10a56fbf948d6b2ef24f64a17b8894863","observation_id":"41f0d6a2-dacd-4685-9ca5-421c3cbd558c","resolution":{"observed_at":"2026-08-07T05:56:56.974688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:56.978614Z","title":"Query by committee,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.978614Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:430787d846e0ab724f14535227d0f2691c2d09ea42a3ece79b9ba91e7e9a96aa","observation_id":"39d584d9-4d79-42ad-a834-f6714631ce83","resolution":{"observed_at":"2026-08-07T05:56:56.978614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.987190Z","title":"A review on edge large language models: Design, execution, and applications,","venue":null,"work_id":"96a0ce57-a82e-492a-8dee-5751fb6b5323","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.982111Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:27b4379556000f1642e67119358980f79658f21bc213b9b411abf6e7192b6ac4","observation_id":"bc603551-9d84-4c2e-8cea-a0e8cf2a4c24","resolution":{"observed_at":"2026-08-07T05:56:57.990897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00088","last_updated":"2024-09-14T04:01:09Z","snapshot_observed_at":"2026-07-06T19:08:26.637143Z","submitted_at":"2024-08-26T03:33:36Z","title":"On-Device Language Models: A Comprehensive Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00088","snapshot_observed_at":"2026-08-07T05:56:56.985768Z","title":"On-device language models: A comprehensive review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.985768Z"},"links":{"cited_paper":"/paper/2409.00088","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:87a0838faa657718bb5ceadf7e9cb200afc56798aac3dc5a8922b39988a9ee0f","observation_id":"92755cfd-9dbb-452b-be1b-aa346eb0f90f","resolution":{"observed_at":"2026-08-07T05:56:56.985768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-05T15:27:19.717152Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-07T05:56:56.989615Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.989615Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8f0cd14c842eed2fce4274f14930ee8483e1a251667278db0d176c461fb7e68a","observation_id":"b897ca20-8400-4e57-94b6-ba9e268f6016","resolution":{"observed_at":"2026-08-07T05:56:56.989615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.976969Z","title":"Research","venue":null,"work_id":"b2af8ddb-985b-4830-b19b-2ffb8809608d","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.993763Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d8108deecee904d5a6b7a62b9b834af23bdee5b3ad4b5835b4a94beb377ef99a","observation_id":"48890071-a8b5-4073-b2c3-b0e37f358712","resolution":{"observed_at":"2026-08-07T05:56:57.980441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.966659Z","title":null,"venue":null,"work_id":"64b14fb1-7afc-4954-86fb-e6dd9b25e73e","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.997453Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:2b204ba856b26600511af4584340b47552732458a60c62002339bf766a84670b","observation_id":"6d0c202c-d3d9-4b8f-aace-aa73d8d9d901","resolution":{"observed_at":"2026-08-07T05:56:57.970312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.956069Z","title":"Edge-first language model inference: Mod- els, metrics, and tradeoffs,","venue":null,"work_id":"603323cf-a4e5-42e4-873b-5c0694d8b8a8","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.001152Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:5c082c013e6ba5995958b087fe79002e14f67c1eb14a279de2f9a416392d9d14","observation_id":"b853f9ce-101b-432a-bc3d-cfbee91bce19","resolution":{"observed_at":"2026-08-07T05:56:57.959881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07584","last_updated":"2024-07-22T07:07:06Z","snapshot_observed_at":"2026-07-06T17:58:43.506575Z","submitted_at":"2024-04-11T09:17:12Z","title":"UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07584","snapshot_observed_at":"2026-08-07T05:56:57.004691Z","title":"Ultraeval: A lightweight platform for flexible and comprehensive evaluation for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.004691Z"},"links":{"cited_paper":"/paper/2404.07584","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:539c9a344d75b8bd370f6cb26222d101fade13ec7df68d83868cf0d197597840","observation_id":"47546da5-a959-4dd8-ae59-e3497242d1d4","resolution":{"observed_at":"2026-08-07T05:56:57.004691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07000","last_updated":"2024-08-30T01:19:42Z","snapshot_observed_at":"2026-07-06T18:43:47.559289Z","submitted_at":"2024-07-09T16:13:26Z","title":"Etalon: Holistic Performance Evaluation Framework for LLM Inference Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07000","snapshot_observed_at":"2026-08-07T05:56:57.008858Z","title":"Etalon: Holistic performance evaluation framework for llm inference systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.008858Z"},"links":{"cited_paper":"/paper/2407.07000","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:24f662a55137afcbaaddc2d1b9756d2fdd55fa86cab377b6480d3f285b468f65","observation_id":"f2707b7c-9c27-42ad-9a28-db59fb148ffb","resolution":{"observed_at":"2026-08-07T05:56:57.008858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-07-06T17:20:00.101661Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-07T05:56:57.013028Z","title":"Mm-llms: Recent advances in multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.013028Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8deecd491d1ef71d3477729cda20724c0efb431a398b156eea9ee9239578ce27","observation_id":"f8fee592-837e-4d70-81fa-7623c76188d6","resolution":{"observed_at":"2026-08-07T05:56:57.013028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00425","last_updated":"2025-08-10T04:13:03Z","snapshot_observed_at":"2026-08-03T13:46:15.251113Z","submitted_at":"2025-02-01T13:08:02Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","version":2},"cited_work":{"arxiv_id":"2502.00425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00425","snapshot_observed_at":"2026-08-07T05:56:57.204200Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","venue":"cs.CV","work_id":"1ddf5ae0-58ac-4c03-8e43-787b44730e95","year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.016882Z"},"links":{"cited_paper":"/paper/2502.00425","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:a4c16708af272fb05f9f4cba3a8c6589fc6f44091b542aff73d70eaecd176783","observation_id":"0a64c309-4bed-4ea1-9647-9e54130324de","resolution":{"observed_at":"2026-08-07T05:56:57.208416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.945959Z","title":"Multimodal large language models in health care: applications, challenges, and future outlook,","venue":null,"work_id":"a7a75943-e57e-456c-890e-be2d616bc3d7","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.020774Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:5b872c81264d533ad84ed7129b69c93c9c78cb2d03298ff6dd2528b186e78326","observation_id":"0d5ee2e9-8d16-4ba5-9f93-528ee93467ee","resolution":{"observed_at":"2026-08-07T05:56:57.949512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.935315Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding,","venue":null,"work_id":"8eb2c771-2a11-4c21-a8a8-cef554e37146","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.024727Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d00c11e9449aaf449352ed7d05b92b159a929d0005be4114430393c74ce440be","observation_id":"37db8c79-d54a-49f6-9a13-f52a9e9359da","resolution":{"observed_at":"2026-08-07T05:56:57.939194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.924247Z","title":"Lexical complexity predic- tion: An overview,","venue":null,"work_id":"ed3ea335-ebbf-4311-ad77-9f9bd7a5ff90","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.028587Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:574502813f3ad4ce724f45c06ad07ea8daab6ea1f4e21cdbe699103330898fc3","observation_id":"8356649b-3d40-4c5e-8c39-f0310af58151","resolution":{"observed_at":"2026-08-07T05:56:57.927904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.913054Z","title":"Collaborative cross- modal fusion with large language model for recommendation,","venue":null,"work_id":"e8aa88f4-dd8a-409b-bd99-72a09632f675","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.032260Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:64e5f5e1608447b46a9f289d923d50adf83219594a538360dc1755de77d0f5c4","observation_id":"45265c53-9cc2-4c58-ad15-7189185fc78c","resolution":{"observed_at":"2026-08-07T05:56:57.916891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14882","last_updated":"2025-03-19T04:21:27Z","snapshot_observed_at":"2026-07-06T20:55:09.392546Z","submitted_at":"2025-03-19T04:21:27Z","title":"Communication-Efficient Distributed On-Device LLM Inference Over Wireless Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14882","snapshot_observed_at":"2026-08-07T05:56:57.036167Z","title":"Communication-efficient distributed on-device llm inference over wireless networks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.036167Z"},"links":{"cited_paper":"/paper/2503.14882","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:58bd0be335a58294a3d4d637271211b7880e512ecfad3b0183eed69a1e7d680f","observation_id":"639313a1-8624-4d86-bd63-0c21eb2fcc4b","resolution":{"observed_at":"2026-08-07T05:56:57.036167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13510","last_updated":"2025-01-07T18:16:17Z","snapshot_observed_at":"2026-07-06T19:05:26.961192Z","submitted_at":"2024-08-24T08:12:22Z","title":"Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13510","snapshot_observed_at":"2026-08-07T05:56:57.040284Z","title":"Intelligent router for llm workloads: Improving performance through workload-aware scheduling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.040284Z"},"links":{"cited_paper":"/paper/2408.13510","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:ff38c55c6dca100895c2f6eff1cc3757d0cae4178f02a1309819acc70ed51ad0","observation_id":"f9cf4371-264d-46b4-9bf7-326b519ac0a1","resolution":{"observed_at":"2026-08-07T05:56:57.040284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08014","last_updated":"2025-02-27T17:56:08Z","snapshot_observed_at":"2026-08-05T22:41:51.926719Z","submitted_at":"2024-10-10T15:09:52Z","title":"Privacy-preserved LLM Cascade via CoT-enhanced Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08014","snapshot_observed_at":"2026-08-07T05:56:57.044447Z","title":"Llm cas- cade with multi-objective optimal consideration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.044447Z"},"links":{"cited_paper":"/paper/2410.08014","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e869481f7170cc97e1b4eba86cb0df1dc01cfc120296ab51b750b7b5cb1911e6","observation_id":"5fa027e9-05a7-4355-bc66-3c02c9e9534c","resolution":{"observed_at":"2026-08-07T05:56:57.044447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00409","last_updated":"2025-07-21T12:20:06Z","snapshot_observed_at":"2026-08-06T21:34:25.868434Z","submitted_at":"2025-02-01T12:08:38Z","title":"Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00409","snapshot_observed_at":"2026-08-07T05:56:57.048415Z","title":"Doing more with less–implementing routing strategies in large language model-based systems: An extended survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.048415Z"},"links":{"cited_paper":"/paper/2502.00409","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:37027e7f5c087ba66251a12d2e8b4c1f60def99a80ab5f91d68815e355e5dc2d","observation_id":"19bbad48-bb75-497c-ae97-ff936e166272","resolution":{"observed_at":"2026-08-07T05:56:57.048415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15248","last_updated":"2024-07-21T19:23:45Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-21T19:23:45Z","title":"XAI meets LLMs: A Survey of the Relation between Explainable AI and Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15248","snapshot_observed_at":"2026-08-07T05:56:57.052089Z","title":"Xai meets llms: A survey of the relation between explainable ai and large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.052089Z"},"links":{"cited_paper":"/paper/2407.15248","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:598221065b576a6414ab0e3081d1ba608ca7b505e4cf51276c869ffc286472e0","observation_id":"ccf21cc0-c770-4c37-83a8-322785e006a9","resolution":{"observed_at":"2026-08-07T05:56:57.052089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12170","last_updated":"2024-12-12T06:27:12Z","snapshot_observed_at":"2026-08-05T16:53:38.370293Z","submitted_at":"2024-12-12T06:27:12Z","title":"PickLLM: Context-Aware RL-Assisted Large Language Model Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12170","snapshot_observed_at":"2026-08-07T05:56:57.056470Z","title":"Pickllm: Context- aware rl-assisted large language model routing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.056470Z"},"links":{"cited_paper":"/paper/2412.12170","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:52449ac468ff6a52cb17ec8a2ac71de8f345d1a4ae6c36e6a3f94bd3a0c643c8","observation_id":"65439416-3169-4241-99f4-6904b9f83c1c","resolution":{"observed_at":"2026-08-07T05:56:57.056470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10785","last_updated":"2023-11-16T18:42:37Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-16T18:42:37Z","title":"Text Sanitization Beyond Specific Domains: Zero-Shot Redaction & Substitution with Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.10785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.10785","snapshot_observed_at":"2026-08-07T05:56:57.132675Z","title":"Text Sanitization Beyond Specific Domains: Zero-Shot Redaction & Substitution with Large Language Models","venue":"cs.CL","work_id":"a890b15b-7213-4e9e-9000-8abbe2a37b5c","year":2023},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.062055Z"},"links":{"cited_paper":"/paper/2311.10785","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:d8540eafa2ff262c23106e92fee0cbf9b28d42a0bfb9550b52caf62485bd195f","observation_id":"2c26cbc3-633d-40a4-8602-45546a00ee96","resolution":{"observed_at":"2026-08-07T05:56:57.138941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:56:57.902523Z","title":"Trusted llm inference on the edge with smart contracts,","venue":null,"work_id":"258c380d-707b-4a47-988b-783202b30b30","year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.066381Z"},"links":{"citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:e0dbeefecee9b81712fe550ca22caade912dd5e4147918f0e31f56e27720ca32","observation_id":"f6fcb862-cb94-4226-a586-8dd499f3a109","resolution":{"observed_at":"2026-08-07T05:56:57.906148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02486","last_updated":"2025-02-21T01:13:08Z","snapshot_observed_at":"2026-08-05T09:53:25.030382Z","submitted_at":"2024-10-03T13:48:35Z","title":"Encryption-Friendly LLM Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02486","snapshot_observed_at":"2026-08-07T05:56:57.070193Z","title":"Encryption-friendly llm architecture,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:57.070193Z"},"links":{"cited_paper":"/paper/2410.02486","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:c64822072fa83a3a61b3180ccf09ad3b5c66cc9a6edf875c0fdc9c7aa0d87194","observation_id":"055c6e2d-3fc3-4bae-b046-10296140e601","resolution":{"observed_at":"2026-08-07T05:56:57.070193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 5 inbound Pith citation observations for arXiv:2506.06579."}