{"as_of":"2026-08-05T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:223cce8c025a27fdc343e96db222c3d727b520af105237cd23bf87d2c521b478","coverage":[{"denominator":229,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:49:10.293120Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.20295/citation-record","integrity":"/paper/2606.20295/integrity","json":"/paper/2606.20295/citation-record.json","paper":"/paper/2606.20295"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15361","last_updated":"2025-08-21T08:43:35Z","snapshot_observed_at":"2026-08-05T17:59:24.133258Z","submitted_at":"2025-08-21T08:43:35Z","title":"A Survey on Large Language Model Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15361","snapshot_observed_at":"2026-08-02T10:48:57.464446Z","title":"A Survey on Large Language Model Benchmarks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:57.464446Z"},"links":{"cited_paper":"/paper/2508.15361","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:39639d230fd07db25883666746723948cb357644abe496c4cfd591ec3e3162d1","observation_id":"346564ca-59ff-4047-9b06-31b8fc02ed89","resolution":{"observed_at":"2026-08-02T10:48:57.464446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:57.664807Z","title":"A Survey on Evaluation of Large Language Models.ACM Transactions on Intelligent Systems and Technology, 15(3):1–45, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:57.664807Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:7eac4e35ab906508f8802317e4f1f0bb911f0a1915eed0436e16afd630b93cec","observation_id":"ac064b73-c90d-441e-a1ce-8c7c424f3e38","resolution":{"observed_at":"2026-08-02T10:48:57.664807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:57.734728Z","title":"Measuring Massive Multitask Language Understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:57.734728Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:d1d8bb4e8a5b626666040d542794f29f7453f3d4af7ea2ab8b41431bcf3be3a4","observation_id":"3daf6302-7309-4785-b7df-097ee5615d15","resolution":{"observed_at":"2026-08-02T10:48:57.734728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-02T10:48:57.968427Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:57.968427Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:82729294032eb39fa03bb8dd4ccef5a3ba2151a8ef9f23a8e34df8124d9314fa","observation_id":"4347beea-dc8c-4661-b59e-046758a29ef1","resolution":{"observed_at":"2026-08-02T10:48:57.968427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:58.040701Z","title":"Holistic Evaluation of Language Models.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.040701Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:96392911b0aaa5cde66d9ba7a5670cdbfdf62a6595e8dfcf2c36075970ebc65c","observation_id":"a04cf945-606c-4710-8c70-40c9ac5b0c0b","resolution":{"observed_at":"2026-08-02T10:48:58.040701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:58.194754Z","title":"Artificial Analysis intelligence benchmarking methodology, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.194754Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:289d678be482aeee2f088e67678287579ec75275608f8d87b4f14b3395bbf095","observation_id":"6ed8bc40-233a-48ce-aad9-060219e30554","resolution":{"observed_at":"2026-08-02T10:48:58.194754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:58.264838Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.264838Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:272fc269eabcd8d95fd2ddff2bcce25b11bf2bac36e6bf0502e37aa0c10638b0","observation_id":"ce52ce6a-7e54-4785-a706-b41d3398dd93","resolution":{"observed_at":"2026-08-02T10:48:58.264838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:58.394754Z","title":"Leaderboard, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.394754Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:a0c275d6eaa7086515d419a7c8e2be1a2aec3ea53ec8a7cdf35276f213860946","observation_id":"6b2b587d-bb30-4052-b4b4-56a80ca39ed6","resolution":{"observed_at":"2026-08-02T10:48:58.394754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:58.484750Z","title":"Quantifying Capability Boundaries: An Application-Driven Analysis for Large Language Model Selection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.484750Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:8c305fd02c8a4fe2c9712ab3825c9b830ffa4acc6cbf3dc14aca0f282bea2905","observation_id":"05a8ba6e-f885-435d-900c-89245db38013","resolution":{"observed_at":"2026-08-02T10:48:58.484750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11164","last_updated":"2025-05-16T01:20:01Z","snapshot_observed_at":"2026-08-03T14:13:51.727302Z","submitted_at":"2025-02-16T15:29:58Z","title":"Quantifying the Capability Boundary of DeepSeek Models: An Application-Driven Performance Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11164","snapshot_observed_at":"2026-08-02T10:48:58.544846Z","title":"Quantifying the Capability Boundary of DeepSeek Models: An Application-Driven Performance Analysis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.544846Z"},"links":{"cited_paper":"/paper/2502.11164","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:5cf38bc47b31f065a75509c010432183c31d7251f5c0eb6500d77862ff4164b1","observation_id":"9d7513cb-f09b-4156-81c9-332fb0536e86","resolution":{"observed_at":"2026-08-02T10:48:58.544846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:58.657311Z","title":"What is the Best Model? Application-Driven Evaluation for Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.657311Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:cc2dfa6ca51066e3139c5f48fb3c46967c16bc189d809bba0e245a63efc9d485","observation_id":"bd96d426-2062-4af3-8eb5-3dcc48540390","resolution":{"observed_at":"2026-08-02T10:48:58.657311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:58.857605Z","title":"Pinchbench-upgraded, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:58.857605Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:f75bbec16732a0c6a6c33056751262a472ef6b384b01c7c249ce17c1d0dd737d","observation_id":"278cf955-18e8-4a38-846d-6f24c43754f3","resolution":{"observed_at":"2026-08-02T10:48:58.857605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09758","last_updated":"2024-09-28T20:44:59Z","snapshot_observed_at":"2026-08-03T09:04:44.024755Z","submitted_at":"2023-11-16T10:30:55Z","title":"OrchestraLLM: Efficient Orchestration of Language Models for Dialogue State Tracking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09758","snapshot_observed_at":"2026-08-02T10:48:59.054827Z","title":"OrchestraLLM: Efficient Orchestration of Language Models for Dialogue State Tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.054827Z"},"links":{"cited_paper":"/paper/2311.09758","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:a5cff57edde0ec8a5515594b1ceee3fc1ee8ebc18a8922161379e59df969e659","observation_id":"98b3b4dd-c93f-4784-af96-2b00e2aa1c2b","resolution":{"observed_at":"2026-08-02T10:48:59.054827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:59.132644Z","title":"Semantic Router, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.132644Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:8d13497232d88460811628137ddb2f8319ce8fc10d0f4f1b076209d6c202adb4","observation_id":"70059fd2-b878-4e06-b9f8-687ccd509a2d","resolution":{"observed_at":"2026-08-02T10:48:59.132644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:59.184829Z","title":"LiteLLM: Python SDK & Proxy Server (AI Gateway) for 100+ LLM APIs, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.184829Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:5fd44b825005eaff12df3b53ab4115f3f1a81fc36007f0584308007eb97f7b10","observation_id":"bbcaa8fe-68aa-4ed4-9b7a-b8260444c222","resolution":{"observed_at":"2026-08-02T10:48:59.184829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14618","last_updated":"2024-04-22T23:06:42Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:06:42Z","title":"Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14618","snapshot_observed_at":"2026-08-02T10:48:59.226127Z","title":"Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.226127Z"},"links":{"cited_paper":"/paper/2404.14618","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:3ebb005e46eaa88fdfe16d14865b2f9d183137c33eb219767fecb2b5b363718d","observation_id":"3b1f1821-007f-48bc-98d3-e62ba70c0699","resolution":{"observed_at":"2026-08-02T10:48:59.226127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:59.274749Z","title":"RouteLLM: Learning to Route LLMs with Preference Data,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.274749Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:7b794d058bb7fca9154fe487169b1bce8d20df2a12fc1c0d1215ba05037cd7ae","observation_id":"be4729ec-b1f0-4633-b381-2c3a8941c1b2","resolution":{"observed_at":"2026-08-02T10:48:59.274749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15789","last_updated":"2023-09-27T17:08:40Z","snapshot_observed_at":"2026-07-06T16:24:30.545494Z","submitted_at":"2023-09-27T17:08:40Z","title":"Large Language Model Routing with Benchmark Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15789","snapshot_observed_at":"2026-08-02T10:48:59.419755Z","title":"Large Language Model Routing with Benchmark Datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.419755Z"},"links":{"cited_paper":"/paper/2309.15789","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:c8166b516511c5b1bb24ddcf24c71797f1108d37455f6a378382f0e41f08116d","observation_id":"c03313af-a61b-45f0-baf8-60dd239c29ea","resolution":{"observed_at":"2026-08-02T10:48:59.419755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:59.534910Z","title":"RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.534910Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:d9904989d31854e23454f8fccab99669c08f2d22e8985f91d52cfd6eb38284b0","observation_id":"e44ef3b8-fcb6-40c4-b8b0-6177b8974505","resolution":{"observed_at":"2026-08-02T10:48:59.534910Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01542","last_updated":"2024-05-09T16:04:20Z","snapshot_observed_at":"2026-07-06T16:26:46.131908Z","submitted_at":"2023-10-02T18:31:35Z","title":"Fusing Models with Complementary Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01542","snapshot_observed_at":"2026-08-02T10:48:59.644900Z","title":"Fusing Models with Complementary Expertise","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.644900Z"},"links":{"cited_paper":"/paper/2310.01542","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:7f3013b88ecd41b09408757939279ed49bff66adc8967d3be1d621ed7b7ef6dd","observation_id":"3d47765f-738e-477a-bdc4-20b7e223ca64","resolution":{"observed_at":"2026-08-02T10:48:59.644900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:59.734847Z","title":"Understanding intelligent prompt routing in Amazon Bedrock, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.734847Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:05b8ef21d8725afafc77c883f323e6cdc1233bd5c3f8dbcda2de8656dfe76135","observation_id":"036338fb-daa8-4603-937e-3c81b675f8a9","resolution":{"observed_at":"2026-08-02T10:48:59.734847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:59.819557Z","title":"Introducing Martian - Better AI Tools Through Better Understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.819557Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:f242d5a5010cfef102d419c98c42eaf240a4fd4eaffa39c11374b298ab646c00","observation_id":"d304121e-8b6f-4772-a6b5-89628dc9af0f","resolution":{"observed_at":"2026-08-02T10:48:59.819557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:48:59.904742Z","title":"Model Routing for Agents, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:59.904742Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:d3710001c6aaf4835183ef3051c2bf5bb2f8ec48b6d08daa49fbfdacd380dd23","observation_id":"806ccf7f-fe27-4f20-baec-9020e33e7e34","resolution":{"observed_at":"2026-08-02T10:48:59.904742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:00.000869Z","title":"OpenRouter — One API for hundreds of models, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.000869Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:7a92f26a701d079e10e388bc2500a4b4e24b4a4ac0937830632f159fd96f733c","observation_id":"d432253e-97b3-435f-a43b-a8444d0616d6","resolution":{"observed_at":"2026-08-02T10:49:00.000869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:00.084751Z","title":"Introducing GPT-5, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.084751Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:c63831ba1d3d1b955cda6ee34f930c2d8730cba94eaa6616cad0d9aa71b62ae3","observation_id":"09d6aac1-ef02-4ce4-ae68-0c5331376dcf","resolution":{"observed_at":"2026-08-02T10:49:00.084751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:00.223510Z","title":"Using LLM intelligent routing to improve inference efficiency, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.223510Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:df2f3d2229fc28ef1fa49c9a7158b3b29e6f212b2024768e48eead2c095206b7","observation_id":"01c7ef23-61b1-4fd3-a1ea-831c2e9ed319","resolution":{"observed_at":"2026-08-02T10:49:00.223510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:00.272052Z","title":"Intelligent model routing, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.272052Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:c5cca32286acf88042c366f041b62c5100ad93d56777e5868e357ad880845558","observation_id":"042483ec-bf50-4bb0-997d-c5affd790eb6","resolution":{"observed_at":"2026-08-02T10:49:00.272052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-02T10:49:00.424815Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance.Transactions on Machine Learning Research (TMLR), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.424815Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:05a69077724e2650ba920ce167006f8b2ebe2bbaf944a00f9a129af365ef8ab1","observation_id":"af0c6fba-9c15-41c4-8f03-c1d9793396ae","resolution":{"observed_at":"2026-08-02T10:49:00.424815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03094","last_updated":"2024-02-08T22:02:22Z","snapshot_observed_at":"2026-07-06T16:27:51.438846Z","submitted_at":"2023-10-04T18:21:17Z","title":"Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03094","snapshot_observed_at":"2026-08-02T10:49:00.720574Z","title":"Large Language Model Cascades with Mixture of Thoughts Rep- resentations for Cost-efficient Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.720574Z"},"links":{"cited_paper":"/paper/2310.03094","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:cfd5e8298e8181f945230e70a51c5e9f33ef6046b94b7534ceec546821cb2d8b","observation_id":"79bf9a32-a2f2-425a-9005-ddfeea326fb8","resolution":{"observed_at":"2026-08-02T10:49:00.720574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:00.800719Z","title":"AutoMix: Automatically Mixing Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.800719Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:6ad53dcd68ad8f3995c16d5bfbb1ad8b3e4760e29fcd0d250cd5298aace0d026","observation_id":"74bcfd1e-f01f-467c-946d-540790e449e1","resolution":{"observed_at":"2026-08-02T10:49:00.800719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:00.928487Z","title":"Tabi: An Efficient Multi-Level Inference System for Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:00.928487Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:fa7836f23fb7ac378298655b1199d861f37c841ad09dd41e02610aca01b28718","observation_id":"88e93f93-4fcc-44c5-a66f-7c0003102685","resolution":{"observed_at":"2026-08-02T10:49:00.928487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03046","last_updated":"2023-10-03T22:16:13Z","snapshot_observed_at":"2026-07-06T16:27:51.438846Z","submitted_at":"2023-10-03T22:16:13Z","title":"EcoAssistant: Using LLM Assistant More Affordably and Accurately","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03046","snapshot_observed_at":"2026-08-02T10:49:01.044830Z","title":"Awadallah, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:01.044830Z"},"links":{"cited_paper":"/paper/2310.03046","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:f5444741daddea4cb47022332d4f871cf188acf945bc51cb840e1157245f431f","observation_id":"6264491b-e95f-4a74-b743-0f06f69208e0","resolution":{"observed_at":"2026-08-02T10:49:01.044830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-07-06T14:25:12.946406Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-02T10:49:01.124963Z","title":"Fast Inference from Transformers via Speculative Decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:01.124963Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:4aef6eec97856ce3f26e56b367000405caf8133b0641d6dbcd7cf441aeb96351","observation_id":"10871e84-2b9b-4ac4-83e3-c3b2005c3bf8","resolution":{"observed_at":"2026-08-02T10:49:01.124963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:01.309687Z","title":"Unity AI Gateway: Configure Fallbacks on Model Serving Endpoints, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:01.309687Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:a8c20e2588f271938c62322a0ce27d11d17ef0ef2f79a96f62bee29993e63337","observation_id":"d9e35fe6-3962-42dd-9395-7a86a4d4607f","resolution":{"observed_at":"2026-08-02T10:49:01.309687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:01.504761Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:01.504761Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:4a8301e8fdd80acf76b7571f2931a48ff6c5514ca5bb90c1b975e44c77e35ccd","observation_id":"073a4f60-e68c-4104-86f6-e7a96754650e","resolution":{"observed_at":"2026-08-02T10:49:01.504761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05120","last_updated":"2024-10-11T09:38:40Z","snapshot_observed_at":"2026-07-06T17:27:03.686119Z","submitted_at":"2024-02-03T05:55:24Z","title":"More Agents Is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05120","snapshot_observed_at":"2026-08-02T10:49:01.710633Z","title":"More Agents Is All You Need.Transactions on Machine Learning Research (TMLR), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:01.710633Z"},"links":{"cited_paper":"/paper/2402.05120","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:cd69b46dce213eea03cd6ffca7369019b9b98087a8ca3ed15757aba5e152a882","observation_id":"f4118e3b-b6d9-4735-8b11-20dc79d87484","resolution":{"observed_at":"2026-08-02T10:49:01.710633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:01.824067Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:01.824067Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:57cc8fca0962e1c341da48d41e0e238bcddaba65d96e83aef3aaa1a2fe72171b","observation_id":"6682f2fa-11f2-4a3c-a781-50fe2fe608fb","resolution":{"observed_at":"2026-08-02T10:49:01.824067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10491","last_updated":"2024-01-22T17:16:37Z","snapshot_observed_at":"2026-08-04T23:37:08.155969Z","submitted_at":"2024-01-19T05:02:46Z","title":"Knowledge Fusion of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10491","snapshot_observed_at":"2026-08-02T10:49:01.931706Z","title":"Knowledge Fusion of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:01.931706Z"},"links":{"cited_paper":"/paper/2401.10491","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:08ccb2efb24e39b97760fc4720411ec4a696a2230171f29f684e7a8c7c107697","observation_id":"f90e1a6e-56d7-49f7-9abf-ceb3e3203cfc","resolution":{"observed_at":"2026-08-02T10:49:01.931706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04692","last_updated":"2024-06-07T07:04:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-07T07:04:10Z","title":"Mixture-of-Agents Enhances Large Language Model Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04692","snapshot_observed_at":"2026-08-02T10:49:02.081223Z","title":"Mixture-of-Agents Enhances Large Language Model Capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:02.081223Z"},"links":{"cited_paper":"/paper/2406.04692","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:35e2fe800b3c464b7950decad3ef4cb7ff7f6c990cdcddf51597aa9342fd1e0b","observation_id":"76875b0a-987d-4f9b-a086-c5f87fe6ce37","resolution":{"observed_at":"2026-08-02T10:49:02.081223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:02.201957Z","title":"Efficient Attention Mechanisms for Large Language Models: A Survey,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:02.201957Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:2a59ceefd9cae0963ace519cb3dc83379945a7e9025b7d9b1df7ecaa74d7ea4e","observation_id":"085e036c-9f0c-40c6-9414-6594d336d71c","resolution":{"observed_at":"2026-08-02T10:49:02.201957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T10:49:02.346773Z","title":"Qwen3 Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:02.346773Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:d8f8af0c6a7b75603045186b9c80ae80b7202f63236a4459f84eb78206b703c8","observation_id":"79f63b3b-284d-4d6e-8e1f-17d70b53b74c","resolution":{"observed_at":"2026-08-02T10:49:02.346773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T10:49:02.492861Z","title":"DeepSeek-V3 Technical Report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:02.492861Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:9d70394a1db97238e47c440871052b57782f3b16b1491c60126d4e8efc4c363a","observation_id":"23dac4b8-f68d-487f-9393-c409c9a40f0a","resolution":{"observed_at":"2026-08-02T10:49:02.492861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26494","last_updated":"2026-07-30T05:04:36Z","snapshot_observed_at":"2026-08-04T22:39:57.646388Z","submitted_at":"2026-05-26T03:16:11Z","title":"The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26494","snapshot_observed_at":"2026-08-02T10:49:02.690693Z","title":"The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:02.690693Z"},"links":{"cited_paper":"/paper/2605.26494","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:41965e320c73b33d9e988d95e0f733c922e2c77f7490cd529c97ba70e169a23a","observation_id":"28e88532-8b0d-4dfb-98ae-1692befcf0fa","resolution":{"observed_at":"2026-08-02T10:49:02.690693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-02T10:49:02.767594Z","title":"Fu, Stefano Ermon, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:02.767594Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:018225db34de09198341e258bd6349b5f33964984523a374802343da6f5cd615","observation_id":"331b9e16-3160-419c-b748-f7530878bd32","resolution":{"observed_at":"2026-08-02T10:49:02.767594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:02.964017Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:02.964017Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:bf751a259c15a0bcea7bf296b9dce011c2b681866c9274e61dfdb468aee5ce8e","observation_id":"30edab7f-fbff-482e-af37-6115862bf3a6","resolution":{"observed_at":"2026-08-02T10:49:02.964017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:03.045692Z","title":"DeepSeek-V4: towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.045692Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:784dbb9ef7572f9bbe1f8760b392c3febe9141644beaf99a60b3d5edbfd47315","observation_id":"9857e8ce-7970-4278-8657-bb80e5bcc916","resolution":{"observed_at":"2026-08-02T10:49:03.045692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-02T10:49:03.114879Z","title":"GLM-5: from Vibe Coding to Agentic Engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.114879Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:7f24ebec47b83d0d08359c2f7873ec10c93a17e19b2ec5d82127d56a40cca2b0","observation_id":"4d1c1899-2a10-4a33-9645-b78c545f7387","resolution":{"observed_at":"2026-08-02T10:49:03.114879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:03.204809Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.204809Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:058d7155dc9404f1f0f1b0033e34e4db7e1d4f0c6fcf4c41cfd0c63b0fc337c1","observation_id":"796b09f8-23b8-48e5-9040-b08e1886d4fe","resolution":{"observed_at":"2026-08-02T10:49:03.204809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:03.392996Z","title":"MiniMax M3: Frontier Coding, 1M Context, Native Multimodality in One Model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.392996Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:ca8fbdbc2189dcc141822212f025344ebdc579b34c770c5b5d9d563e2ce5ef39","observation_id":"46b5f8fb-b3aa-4aa1-ad94-52d9983f47e5","resolution":{"observed_at":"2026-08-02T10:49:03.392996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-02T10:49:03.511163Z","title":"Qwen3.5-Omni Technical Report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.511163Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:5627093ffe5ef65a5a69fa88244f9e4ef266fb023aba4a1740a4cf094b195966","observation_id":"8792c76f-5bc4-4e7a-9eae-ce6a4bc2a184","resolution":{"observed_at":"2026-08-02T10:49:03.511163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-02T10:49:03.636799Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.636799Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:a68745a60479b87c3d9953961bdda8c6829fed1eb2abb214e28d384b0a36e10b","observation_id":"4005949f-3263-4849-836f-7cb216e74948","resolution":{"observed_at":"2026-08-02T10:49:03.636799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:03.769546Z","title":"A Survey on Mixture of Experts in Large Language Models.IEEE Transactions on Knowledge and Data Engineering, pages 1–20, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.769546Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:1cb8cbac4d79d0f36e2941ab19b6ede03893cb43877ecd791970ff1aabc1ed8d","observation_id":"21ec33ad-7dc9-4131-9cb8-3c9bdb8e2892","resolution":{"observed_at":"2026-08-02T10:49:03.769546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-07-06T09:33:58.857566Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-02T10:49:03.823350Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.823350Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:243412823869f449c985ee93976e404df2d8f987c16616e3e5bb6571919fc85c","observation_id":"752887d1-532a-413d-8a6c-4370820297b3","resolution":{"observed_at":"2026-08-02T10:49:03.823350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-02T10:49:03.928187Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:03.928187Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:ac74d79330672b94cc10662581535f87f5cb2d7a068af80bbd92991d84ea304c","observation_id":"4d4d7277-04dc-426f-a06f-fb2047358bb9","resolution":{"observed_at":"2026-08-02T10:49:03.928187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-02T10:49:04.027295Z","title":"Jiang, Alexandre Sablayrolles, Antoine Roux, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.027295Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:3231234cfa4e9d938a3f4baf8c63d50741e123045c5bff47d5b8f8b128381269","observation_id":"6fed5def-d20b-4922-93a4-9eceb84efe47","resolution":{"observed_at":"2026-08-02T10:49:04.027295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:04.126215Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.126215Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:2eb87a5100e5d9e3679d29931d5f0bcbc95b6c909f93eca9d0f56ddaa0a7058c","observation_id":"823d9b52-e50c-4cfd-9809-119b100c5d2f","resolution":{"observed_at":"2026-08-02T10:49:04.126215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-02T10:49:04.221071Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.221071Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:25923b1ffa92546334aadbcee1ade9e1c28e8e5d6900d139821271519ab439bd","observation_id":"154f4660-b663-4a73-a7f5-aea7385bebf2","resolution":{"observed_at":"2026-08-02T10:49:04.221071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:04.312976Z","title":"TensorRT-LLM expert parallelism documentation, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.312976Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:e6dfe87dfb40f065091c7b23748c462c844d293569a9d9a472713a72db2b1009","observation_id":"5942b97a-fedc-4394-b856-be89cd3949c4","resolution":{"observed_at":"2026-08-02T10:49:04.312976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05066","last_updated":"2026-05-11T07:44:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T01:11:39Z","title":"Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05066","snapshot_observed_at":"2026-08-02T10:49:04.391670Z","title":"Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.391670Z"},"links":{"cited_paper":"/paper/2503.05066","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:11994cf4bf322c20d2396454e52275c3c8378de1a4b41979ed3bab8bbe07218c","observation_id":"9e6ae66b-3612-40d8-b652-57c992a9fed2","resolution":{"observed_at":"2026-08-02T10:49:04.391670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23108","last_updated":"2026-04-28T02:47:36Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T02:05:56Z","title":"Mixture of Heterogeneous Grouped Experts for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23108","snapshot_observed_at":"2026-08-02T10:49:04.554166Z","title":"Mixture of Heterogeneous Grouped Experts for Language Modeling, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.554166Z"},"links":{"cited_paper":"/paper/2604.23108","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:31b2b3c888e0f44952da99660ad0209834b13397d0f532cb4b32032520deca52","observation_id":"09543c80-a541-4cf9-bdfb-03b6e6569b12","resolution":{"observed_at":"2026-08-02T10:49:04.554166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:04.626625Z","title":"Optimizing for the Shortest Path in Denoising Diffusion Model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.626625Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:51d2da7b43139213dd1691a7ca4d916f7dbc64e5f84a3ceced9f91cf6f3c67c8","observation_id":"f86d142c-53ba-4e73-8ddd-21e8f2d504c9","resolution":{"observed_at":"2026-08-02T10:49:04.626625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:04.805876Z","title":"A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.805876Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:a6bdfaa3b2d8a7d7e0f411c8d7203c5cbea21ef442d2083d3f9f5463d305387f","observation_id":"5044a919-65cd-406f-a2b2-37cc13d35210","resolution":{"observed_at":"2026-08-02T10:49:04.805876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:05.025293Z","title":"DeepCache: Accelerating Diffusion Models for Free","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:05.025293Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:616d2a9ce0aac3c44bfd68ce6ea18a2543415a92172bc0a2f4ee723264590c53","observation_id":"46d8602d-7dfd-4bd5-bf8d-7762ec8a350e","resolution":{"observed_at":"2026-08-02T10:49:05.025293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19108","last_updated":"2025-03-18T04:49:23Z","snapshot_observed_at":"2026-07-06T19:58:31.184255Z","submitted_at":"2024-11-28T12:50:05Z","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19108","snapshot_observed_at":"2026-08-02T10:49:05.219314Z","title":"Timestep Embedding Tells: It’s Time to Cache for Video Diffusion Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:05.219314Z"},"links":{"cited_paper":"/paper/2411.19108","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:5369d21e8b266a280189b4384d0569e0fa0be902817a885bc88e30c8e8a5dbac","observation_id":"9ab818e2-6e84-40f3-9a27-5b79999ae9de","resolution":{"observed_at":"2026-08-02T10:49:05.219314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:05.420685Z","title":"Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:05.420685Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:acbd599ef65fc489a18b7ad382547c04c0fbc7a541e15f0b3473e92cfa306311","observation_id":"5d2edd56-123d-4481-b2aa-ba942ff026b5","resolution":{"observed_at":"2026-08-02T10:49:05.420685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:05.554576Z","title":"LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:05.554576Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:ca5f39153d876ba5d5498d47a4370f5c252e037002f04f224f176176757f02f6","observation_id":"25b1704c-4eff-48d9-817d-57434c328938","resolution":{"observed_at":"2026-08-02T10:49:05.554576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:04.685324Z","title":"URLhttps://doi.org/10.1109/cvpr52734.2025.01679","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:04.685324Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:d732c7bf352271b5199072f5b986268e5e899fa926b0a0cfc84e8068b9917bf9","observation_id":"bc6a258e-0061-4c31-9202-f35d94671705","resolution":{"observed_at":"2026-08-02T10:49:04.685324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:05.829494Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:05.829494Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:7c704da0768f0f03bc25084ac178fcb854671a55555cf292fc69897c691fa95c","observation_id":"e4cea724-1380-47ac-a689-50e23834ee45","resolution":{"observed_at":"2026-08-02T10:49:05.829494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-03T04:30:54.138138Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-02T10:49:05.903146Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:05.903146Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:36ea75dac204393bf452608cf69e743ab6dbc731466df303815a0421333640d9","observation_id":"33147e5a-3de8-44a2-bd67-d85895322ba7","resolution":{"observed_at":"2026-08-02T10:49:05.903146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-05T03:08:42.211484Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-08-02T10:49:06.089278Z","title":"STaR: Bootstrapping Reasoning With Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:06.089278Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:f18c7774d479608cd259fe83c11f2e5b8731b8a80c42a08e4367f2ec4cafadb3","observation_id":"e64d0a0e-2dac-4d20-a294-4c6db1de7d35","resolution":{"observed_at":"2026-08-02T10:49:06.089278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-02T10:49:06.290662Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:06.290662Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:44e1fe5694759b4cb2fd0fd3d7a784346754727042ac8fe5d565c179e09c0ff0","observation_id":"e0deaae1-8abf-40a5-99ec-cd79efb0c0fe","resolution":{"observed_at":"2026-08-02T10:49:06.290662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-02T10:49:06.444925Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:06.444925Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:75400078f3739a30b979d1595aa35fb49a9c1176dc5d5ddcedd74b62aab457dd","observation_id":"c663ffe0-4920-44e0-8cc2-90ec60ad3b15","resolution":{"observed_at":"2026-08-02T10:49:06.444925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:05.696593Z","title":"MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:05.696593Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:9314f9cf568356ae593e60abd887cb373ab3398ca12207f00521b69cfe487b22","observation_id":"6b134d8b-b57b-4595-954f-0172c6b06cbf","resolution":{"observed_at":"2026-08-02T10:49:05.696593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:06.767008Z","title":"Introducing OpenAI o1-preview, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:06.767008Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:21ba47e77dd9e2b9a18f56f4ff18f01ffc2e76afb609f587c526f6f0e5b2527e","observation_id":"d2dbebe4-e549-4409-80cd-5c3d59996158","resolution":{"observed_at":"2026-08-02T10:49:06.767008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:06.899051Z","title":"OpenAI o1-mini: Advancing Cost-Efficient Reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:06.899051Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:1d19ba7fa95fa5f66a60b26276cecbc215712ddcda5c2878277b2362cd845104","observation_id":"4fc60caa-809f-40aa-82dd-0e771119ea81","resolution":{"observed_at":"2026-08-02T10:49:06.899051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T10:49:07.038720Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.038720Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:96b1de79ee2d408e9caabffb4a735f7f340f0a501209274228280663c0ebac54","observation_id":"918cdb75-9f74-49c5-b883-8e0588268a54","resolution":{"observed_at":"2026-08-02T10:49:07.038720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:07.118728Z","title":"Claude 3.7 Sonnet and Claude Code, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.118728Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:d63967ca39b54e02b26802f7aba2abd06bb8f584bac5c904f981671281275abd","observation_id":"7d12a6c4-a4f7-4709-a7ac-ac1098935bb7","resolution":{"observed_at":"2026-08-02T10:49:07.118728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:07.261838Z","title":"Qwen3: Think Deeper, Act Faster, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.261838Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:0fe3be8c6af434e29f2c4c218be80bad64b210a0d0339f4dce49b41a0aeb2f10","observation_id":"92a2fd96-c260-4b28-b870-1c999ce109a8","resolution":{"observed_at":"2026-08-02T10:49:07.261838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10435","last_updated":"2023-01-27T15:30:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-18T18:56:13Z","title":"PAL: Program-aided Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10435","snapshot_observed_at":"2026-08-02T10:49:06.599436Z","title":"PAL: Program-aided Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:06.599436Z"},"links":{"cited_paper":"/paper/2211.10435","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:8cf89302f6f1e48f1edb552226effecb07feb7fe525d59617557f6d247a2d3e6","observation_id":"4b778c97-dd94-4e3a-bcfb-e32edf682df5","resolution":{"observed_at":"2026-08-02T10:49:06.599436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-05T13:27:46.877171Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-02T10:49:07.509981Z","title":"Token-Budget-Aware LLM Reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.509981Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:97d700bc567ec10ba7bb96ad4cf2fc11b73e6c75b1a6481c8ea6bb5c99c81979","observation_id":"afebed7d-1074-402b-8971-541e6cb0e5d6","resolution":{"observed_at":"2026-08-02T10:49:07.509981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:07.595312Z","title":"Training Language Models to Reason Efficiently, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.595312Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:3121123ee4af342153bc76c0498bc67217b7d2c492670ed182755d0958b11756","observation_id":"6e6b6886-b098-4cb7-a803-5960017cd5f4","resolution":{"observed_at":"2026-08-02T10:49:07.595312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-07-06T21:37:23.562748Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-02T10:49:07.680058Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.680058Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:e688d61187103726e4c2296692de7a76beffd2a9630d77324e8ec6c308140e05","observation_id":"3e778285-b681-44bd-9652-4e0890b5ae65","resolution":{"observed_at":"2026-08-02T10:49:07.680058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18600","last_updated":"2025-03-03T17:08:21Z","snapshot_observed_at":"2026-07-06T20:42:42.466871Z","submitted_at":"2025-02-25T19:36:06Z","title":"Chain of Draft: Thinking Faster by Writing Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18600","snapshot_observed_at":"2026-08-02T10:49:07.851036Z","title":"Chain of Draft: Thinking Faster by Writing Less, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.851036Z"},"links":{"cited_paper":"/paper/2502.18600","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:a20e7cd19984090fe1a9b433ec9e11a61b4655781677b1fdf51deb2d65e51cd2","observation_id":"539991cc-9c8d-41e7-8bd2-eaaf0a050631","resolution":{"observed_at":"2026-08-02T10:49:07.851036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:07.996094Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.996094Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:d550a01e1b96859e791467f51ce55fa1e8e7e116b76849f0625ec689c3704f2e","observation_id":"31c1834d-7bdf-412a-af12-a1ac28ffe6f3","resolution":{"observed_at":"2026-08-02T10:49:07.996094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:07.436090Z","title":"Gemini Thinking / Thinking Budget Documentation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.436090Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:335061900520f0412163e6582ca5169c9e9d13f1b938c416b21bafdf104b1daa","observation_id":"c7d3ed97-fc43-45b0-90a9-7be4101e2782","resolution":{"observed_at":"2026-08-02T10:49:07.436090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-02T10:49:08.460425Z","title":"Training Large Language Models to Reason in a Continuous Latent Space, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.460425Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:0fc6c5c3a28846ca2feffa3f290d033e656babaebf53775ac26c7fd6d4a8deb8","observation_id":"4a3c52c4-5d7a-4d58-b08b-52db7a206f91","resolution":{"observed_at":"2026-08-02T10:49:08.460425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:08.641974Z","title":"CoThink: Token-Efficient Reasoning via Instruct Models Guiding Reasoning Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.641974Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:1355b645e3afa5c7eb5edfb7e3502ab81ede99338d686e2a3065a5af78364c53","observation_id":"61f2ca49-624e-4967-9372-58323ae51aaf","resolution":{"observed_at":"2026-08-02T10:49:08.641974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:08.741395Z","title":"Not all tokens are needed(NAT): token efficient reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.741395Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:99da0a88109c113ad0fc39a8fe9b09a98ffd4406fb42a11abd648b0137abdcb8","observation_id":"2d6f35f9-5d49-4796-a474-4cdbc43f7ded","resolution":{"observed_at":"2026-08-02T10:49:08.741395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-03T03:23:56.857266Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-02T10:49:08.899979Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.899979Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:6d4dda515cf872108c51d4d4666d01d476a0dcc48e42a4e23bd07b4ed6b59fe7","observation_id":"628fae5f-3e9e-44f2-bdc2-ca30acbcb9bd","resolution":{"observed_at":"2026-08-02T10:49:08.899979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:09.111767Z","title":"DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.111767Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:865d27b7cf9bac44b15b430aecd56f0f7ce1465e0d1aa2ed7320c740aa599100","observation_id":"7c063d0c-f510-4323-8a62-cb1e4fdb1acb","resolution":{"observed_at":"2026-08-02T10:49:09.111767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-07-06T21:31:25.665892Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-08-02T10:49:08.087657Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.087657Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:2b4f56d41cfb55d3f4f1ef158c7183d2ced0686eb30f61db8d140d4065e82ac2","observation_id":"e6967e08-c3c8-4e23-8297-c4dd9a0ee001","resolution":{"observed_at":"2026-08-02T10:49:08.087657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:08.197707Z","title":"Wait, We Don’t Need to “Wait”! Removing Thinking Tokens Improves Reasoning Efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.197707Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:7e96ee6d612d4bf3ec20a218bfaf224a2417ac17d88307cd6b1acafc2b0839bd","observation_id":"001e5436-9734-4b45-9811-0f72ac0f110d","resolution":{"observed_at":"2026-08-02T10:49:08.197707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-02T10:49:09.474424Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.474424Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:bcac1aea58d6585717bfc58d0ab22654d32637cab522e4975eab835e318dda28","observation_id":"e5a4b728-78aa-4493-b919-037f666fbf1f","resolution":{"observed_at":"2026-08-02T10:49:09.474424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-02T10:49:09.539883Z","title":"V oyager: An Open-Ended Embodied Agent with Large Language Models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.539883Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:4895245be58388888263b159000ce2073e236f2fec8b1c2bb5def9166446b215","observation_id":"ac3354e6-79e0-49a3-b8c9-9f563ba7cb3f","resolution":{"observed_at":"2026-08-02T10:49:09.539883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10144","last_updated":"2024-12-20T06:14:53Z","snapshot_observed_at":"2026-08-02T16:16:44.130627Z","submitted_at":"2023-08-20T03:03:34Z","title":"ExpeL: LLM Agents Are Experiential Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10144","snapshot_observed_at":"2026-08-02T10:49:09.625770Z","title":"ExpeL: LLM Agents Are Experiential Learners, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.625770Z"},"links":{"cited_paper":"/paper/2308.10144","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:cfcd79a92194c01f109528452c532715fd877b686ec9c20c2fa45e2ca93af350","observation_id":"42e661ae-2a81-4114-bb30-8d421bd7cf8a","resolution":{"observed_at":"2026-08-02T10:49:09.625770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:49:09.743560Z","title":"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory, n.d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.743560Z"},"links":{"citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:c7a543ae3e0387f7e19ed1c75e93209d7f724c50955f23603e7870c9fc1f7ab3","observation_id":"73edc426-d1ec-4b53-95e4-de3c6fde6793","resolution":{"observed_at":"2026-08-02T10:49:09.743560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13956","last_updated":"2025-01-20T16:52:48Z","snapshot_observed_at":"2026-07-29T15:53:45.545304Z","submitted_at":"2025-01-20T16:52:48Z","title":"Zep: A Temporal Knowledge Graph Architecture for Agent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13956","snapshot_observed_at":"2026-08-02T10:49:09.841988Z","title":"Zep: A Temporal Knowledge Graph Architecture for Agent Memory, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.841988Z"},"links":{"cited_paper":"/paper/2501.13956","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:1cf4a69d4f57facccd25e2134c3068192de68522408ca2051d00094080629ee5","observation_id":"8ce66f34-3b61-4416-89e5-960d6e1df9c1","resolution":{"observed_at":"2026-08-02T10:49:09.841988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10250","last_updated":"2023-05-21T06:20:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T14:40:29Z","title":"MemoryBank: Enhancing Large Language Models with Long-Term Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10250","snapshot_observed_at":"2026-08-02T10:49:09.273065Z","title":"MemoryBank: Enhancing Large Language Models with Long-Term Memory, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.273065Z"},"links":{"cited_paper":"/paper/2305.10250","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:43e757f56bff81deb54646886ffe2ea65b35509f7e91a9afa35262b68ec877a9","observation_id":"cc653dad-8818-4263-bc61-a79a5d0343aa","resolution":{"observed_at":"2026-08-02T10:49:09.273065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-03T06:31:15.541423Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-02T10:49:09.369986Z","title":"MemGPT: Towards LLMs as Operating Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:09.369986Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:5df295af4c7a6718cbb8d0cbeff1338112cd8f096b865a99301f20d08c68d2e9","observation_id":"c65e98c0-5bb2-4827-8861-b5d27f3cb1c1","resolution":{"observed_at":"2026-08-02T10:49:09.369986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-01T23:32:07.108143Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02259","snapshot_observed_at":"2026-08-02T10:49:10.293120Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:10.293120Z"},"links":{"cited_paper":"/paper/2507.02259","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:4dfb56d0f7ae8d5bc64db08768dac4f3443614683a013b782c2ccdd838b795dd","observation_id":"a411dd21-0e1f-4e6a-9edb-796f4e9e51df","resolution":{"observed_at":"2026-08-02T10:49:10.293120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":229},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 229 outbound references and 0 inbound Pith citation observations for arXiv:2606.20295."}