{"as_of":"2026-08-10T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a695a80938c492ce33e47e2e5119f73ea003de3ed71b8c484e2ef07a445d1c9c","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T03:21:01.687528Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06601/citation-record","integrity":"/paper/2607.06601/integrity","json":"/paper/2607.06601/citation-record.json","paper":"/paper/2607.06601"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.443946Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"451e5509-ddba-43d2-b361-4bf176f9cc1e","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:a5c7cd85ab4d7788c76a8d488844f72cf7a952d3b0a4db927f06503c292c5c5c","observation_id":"c6f1d44a-58a3-41cf-9474-5a12fd4a3c62","resolution":{"observed_at":"2026-07-11T03:27:49.460673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.261092Z","title":"CoLT5: Faster long-range transformers with conditional computation.Empirical Methods in Natural Language Processing (EMNLP), 2023","venue":null,"work_id":"7371395e-1352-4821-b5bc-fb27e2b0beb1","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:5e1c53a02b2ad2992e14a9203e9ad44e98b937a57f3f169850efba07a0252c04","observation_id":"a16e609c-2b80-4a1f-87fb-deb0281fda50","resolution":{"observed_at":"2026-07-11T03:27:49.286954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:15bfc6c6f26ed5276ad00992f71eafd5e69f2ca3d3cb7197825b764bc5f59e7b","observation_id":"8cf0eac4-4837-4025-bc5b-debbfb13014b","resolution":{"observed_at":"2026-07-11T03:27:46.701443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:43f0e2cb35031ad69fc8397f61ec35260f2567c9f4f47b9f883f58e40af37cdb","observation_id":"b7702268-9035-4e0d-a534-eb861ed63f8e","resolution":{"observed_at":"2026-07-11T03:27:46.831362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.543663Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"081bbb47-663a-4e24-a196-55e54f31df34","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:2488f5be898f8742de0279b48e033e907890b65fcf1f73cf7d4f92a92ed2bbab","observation_id":"bc05f8c9-fe22-45da-a4e6-80438af1be29","resolution":{"observed_at":"2026-07-11T03:27:49.564973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.229865Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"618d0d25-e69e-4bbe-aa2e-5b18cfc4ba7c","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:9b01f17e7e95db100eeb575aac3b63a04f521e5742517d8e63a27ef732aba1fb","observation_id":"3b0a26b1-31fe-4e36-854a-cf17470d6d34","resolution":{"observed_at":"2026-07-11T03:27:49.257627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:dc81ac3cb9e65efe8a3a520264f15c2b6127ac4ad498951bbe61d7b3ab353690","observation_id":"c12fb47b-8289-42ca-b7e2-90b16f86ea63","resolution":{"observed_at":"2026-07-11T03:27:46.912589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.290669Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"b1ec6ad1-4a87-49d4-bde5-f76c3f357c2f","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:6ac10bdd080cd1faa550016a7c6a15353ebdc360ac08937cf04efc54a40e9bff","observation_id":"1a129485-6300-444e-ba64-894f24bef20b","resolution":{"observed_at":"2026-07-11T03:27:49.317762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:216e03d9c4b3428c7dd6e2495ce92b2aea8406e9620ead1da008a27e79d8e394","observation_id":"4ee84a84-2d37-43f6-8e2f-590d3752ad65","resolution":{"observed_at":"2026-07-11T03:27:46.940199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:51d040cd7970189bb7e6b7e37861e7d743b17912c456acf1e5653a885f3a3857","observation_id":"a2cc56b8-e4e2-46f3-b6e9-a57a31b824c9","resolution":{"observed_at":"2026-07-11T03:27:47.082510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07987","last_updated":"2024-09-30T21:19:29Z","snapshot_observed_at":"2026-08-03T12:04:56.535363Z","submitted_at":"2023-12-13T09:00:21Z","title":"SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention","version":3},"cited_work":{"arxiv_id":"2312.07987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.07987","snapshot_observed_at":"2026-07-11T03:27:46.660519Z","title":"SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention, September 2024","venue":"cs.LG","work_id":"ccf4f481-e6c9-4911-9040-cacbf6460992","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2312.07987","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:48cb670c49b550e5956141688d88d656c4f217bbec214f9abff367c9dcd3b355","observation_id":"93ac1217-3f18-4a5a-8422-1ebd631c2aa1","resolution":{"observed_at":"2026-07-11T03:27:46.677614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:0a03847ac8d5077fef29b089aee5846d2ab7c38cb315e493a089cee997b267b7","observation_id":"ec68947d-eccb-489f-8947-d8a121a03339","resolution":{"observed_at":"2026-07-11T03:27:46.995209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.168075Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"e5783130-2780-45b8-acc5-8d738e2d3e5e","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:68f55447b1d74fdcbe03b8647fa7687986bf2f7ab8d28501e9fbb10bb79e0588","observation_id":"f27b0295-16d3-4eca-a599-62b153aec92e","resolution":{"observed_at":"2026-07-11T03:27:49.197139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:82d12a987b1463efeb01df0c02fb0c16f4714a3f7d6f724aadef1f771c04aa90","observation_id":"c87a8819-21cc-48ac-9b77-812de7079b25","resolution":{"observed_at":"2026-07-11T03:27:47.022883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.756423Z","title":"Uni- versal transformers","venue":null,"work_id":"c95f928b-c318-4fb0-ba2c-d40910ad92b7","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:2b77a8a6c9816f847295a4e7ba8f65fd9d28950a5a809d532e25c0c505b10613","observation_id":"30ed05dd-f00c-404d-939d-fd0b287cbb43","resolution":{"observed_at":"2026-07-11T03:27:49.776327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.827543Z","title":"LLM.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":"233320f9-9aea-4831-9900-397cb319d078","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:5e54212ea02deaf6bb5c648b58bcdec0b80a00d8b99230c119d3ec0b4aeecf03","observation_id":"041e54fe-3af4-4cc1-8138-80c06638c52e","resolution":{"observed_at":"2026-07-11T03:27:49.848528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.954164Z","title":"QLoRA: Efficient finetuningofquantizedLLMs","venue":null,"work_id":"16434af3-29b1-4432-8966-dcbc232ba4ba","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:9d4c6396f02ee56ba9a9861f240c5d061c79b12d3a20e2788044ba813e01cca6","observation_id":"154b7390-4c5d-4d04-b6be-58eeeb3c2292","resolution":{"observed_at":"2026-07-11T03:27:49.975482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.200546Z","title":"Depth-adaptive transformer","venue":null,"work_id":"3f2058d3-bd42-46b2-bbbf-b60034bbd597","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4fd99349a44881fac9aa1324fe46137f67794f9fd117e0c0d69d8a3040ae4b01","observation_id":"598e965d-9d08-4985-ab32-4b9b2ac4af9b","resolution":{"observed_at":"2026-07-11T03:27:49.226857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.141237Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":"b6c0caad-21a5-4aba-b3eb-e93282a09df0","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:ce8a90f0e868eccbf9b5a4e108e0cefa01032574ff83a3d84db811c0ce2c7bc7","observation_id":"83ca5649-5439-469e-a9ec-eb14d5177954","resolution":{"observed_at":"2026-07-11T03:27:49.163885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.134131Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research (JMLR), 23(120):1–39","venue":null,"work_id":"60697aeb-c914-4bce-a7b0-365bd7a943d6","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:e410313adcd0ddfaa72b10ba2fc3f5b676fb69022cfaeb52481ede244616d0f8","observation_id":"5ddb967a-5b0f-4a43-b651-12448e90d709","resolution":{"observed_at":"2026-07-11T03:27:50.163282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.011497Z","title":"GPTQ: Accurate post- training quantization for generative pre-trained transformers","venue":null,"work_id":"1fb76a5c-2e4e-4e84-b3ab-b7c9cac06574","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:d5787e3bcf4a62337a3d03af9563fef51a0ce5c612d358866eb925209d125304","observation_id":"27c5362e-215d-4238-bcf4-7944a43492d5","resolution":{"observed_at":"2026-07-11T03:27:50.035466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.875173Z","title":"MegaBlocks: Efficient sparse training with mixture-of-experts","venue":null,"work_id":"c49880cd-e000-440c-8281-98343da128ea","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:5aa32f0c1251e2636e61149a032abed226507a13ea11cb60340d10aeacf72225","observation_id":"23a0a73d-f166-400d-ab5c-b204819a0901","resolution":{"observed_at":"2026-07-11T03:27:49.893346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:2ac27e1ae92413b996e2a68d97d1d5e015f39eebede55bcb343c00582e6b06af","observation_id":"9c4179aa-6bcf-4687-bac6-b8be76258c17","resolution":{"observed_at":"2026-07-11T03:27:46.756821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":"1603.08983","doi":"10.48550/arxiv.1603.08983","metadata_source":"pith","pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive Computation Time for Recurrent Neural Networks","venue":"cs.NE","work_id":"75565443-173e-479c-b0e7-d2464e7630be","year":2016},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4a123ef9d02b6cee00065a662ea33f16841400002bf96f1d49e4209cce1b4e78","observation_id":"c62f7489-23b5-419c-82aa-bd80143974bd","resolution":{"observed_at":"2026-07-11T03:27:46.968390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:03b3ccaf6d665a7868cbfbd72d393f4ea14c3d5dd03601d80f4d55222021aa11","observation_id":"173ff941-c038-470c-b100-ab2a3fd97b21","resolution":{"observed_at":"2026-07-11T03:27:47.112092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.805633Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":"78953019-8f03-471c-b366-c2ade0049322","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:92068aba8916499d92c8344f81ed41d9f616af3ae20ad28933f42351b720f84a","observation_id":"447465bc-217c-40b2-b1e1-c99de9d7778d","resolution":{"observed_at":"2026-07-11T03:27:49.822401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.568028Z","title":"Categorical reparameterization with Gumbel-Softmax","venue":null,"work_id":"eb0de53d-c02a-49a4-bf0f-346b8261389f","year":2017},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:7015f2ee145a59aead75a6c0f0337ac3587d82486f2298856b83760eb851ecb2","observation_id":"d8079ba3-b840-4b15-b822-0e11de00c7b1","resolution":{"observed_at":"2026-07-11T03:27:49.588414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:00ef04f3c6ee0de30d20ed59cb1bd8b9b43ce9b7153644a8e42509b764d34c06","observation_id":"4d7f81cf-1db6-4dc2-bc20-210a94521bac","resolution":{"observed_at":"2026-07-11T03:27:47.053111Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:13f7eb46ca30aa59831bebfd36be7ae8663739514196ca717680f1beee9dc8a3","observation_id":"f455abdb-917b-4b0c-8a6a-cf324a73ccb5","resolution":{"observed_at":"2026-07-11T03:27:46.858674Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.463967Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"44e4dcb8-056d-4a7a-8f38-33ed28d30b53","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:958854121d90589353d9d8b89b523edf320c5f935acad9455b803c6c4ed61b6c","observation_id":"6b209d01-b2f7-43ec-80d0-7e88dae93dc2","resolution":{"observed_at":"2026-07-11T03:27:49.484593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.414262Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"213bdeab-8322-484e-b315-095023e5166a","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:2baacb621fbeb31b5f198edfdc9ffa2dd251fc234dcf7e9b5d563c23f7be4c41","observation_id":"59880c2d-1f14-4510-a899-7a49269fdf5e","resolution":{"observed_at":"2026-07-11T03:27:49.438218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.339770Z","title":"BASE layers: Simplifying training of large, sparse models","venue":null,"work_id":"f3974bef-7236-404f-a92c-34f84d9ca20d","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:91ac631cad829d874e784d56bd846078aae68f1970b7331bee71c28573f5615a","observation_id":"d2ac180e-cd6c-4a02-848a-411688e49dd3","resolution":{"observed_at":"2026-07-11T03:27:49.361501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.851350Z","title":"KIVI: A tuning-free asymmetric 2bit quantization for KV cache","venue":null,"work_id":"4cfaa815-a171-4fcc-ae26-647d0b628d5a","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:3ac0d59ea25e52c6811379b7aaae4c2d5ac0a29a82b1127162df53f5a3a8e87f","observation_id":"1c18df4a-df0c-441f-a228-00bc96886f8c","resolution":{"observed_at":"2026-07-11T03:27:49.869405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.924579Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a1e3c974-0c48-43bd-8f29-52f24e5371c5","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:8f35a2247759abe0bab57eea1264677409c5b10320de3716244942fc97b169fe","observation_id":"81774670-d3d7-4251-aa82-f834564c41d1","resolution":{"observed_at":"2026-07-11T03:27:49.951476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.895715Z","title":"Maddison, Andriy Mnih, and Yee Whye Teh","venue":null,"work_id":"ce42633a-cc2c-4e44-b80a-72a104960319","year":2017},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:a735190aa97d4d35dc7daa560492427228d9711ddac58a5324b4c3defe1d56f1","observation_id":"723db302-6504-4e02-97b7-aeef251d373a","resolution":{"observed_at":"2026-07-11T03:27:49.919615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.981436Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"e699764a-5082-4826-85d5-1f42e6f8edfe","year":2016},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:89c9f72cf9cb7db2cdcd61d97707aa2b72b0ffb015a6aa24cf1045985eb00cd8","observation_id":"572dd9e7-eb83-45d0-8494-342a99c2ec90","resolution":{"observed_at":"2026-07-11T03:27:50.005465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.040816Z","title":"DeepSpeed-MoE: Advancing mixture-of- experts inference and training to power next-generation AI scale","venue":null,"work_id":"ced48599-af36-4b32-9fee-5ce0fa537bab","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:011efe9343e4b427db2e271531bf88f1c423d5c4117d0e87a09a7a352a7b68ab","observation_id":"0323126c-2c9c-4f04-844f-889b0cfff867","resolution":{"observed_at":"2026-07-11T03:27:50.063823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":"2404.02258","doi":"10.48550/arxiv.2404.02258","metadata_source":"pith","pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","venue":"cs.LG","work_id":"6dcdd707-a37b-49a9-9531-4fc6f5b9ed84","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:4604a9889bdac82f1b6bed068ed046f74bdbc82d5ca847f9f9c1c820ac921d5b","observation_id":"47498db2-1298-4c4a-a40d-b0f60a7031c0","resolution":{"observed_at":"2026-07-11T03:27:46.733714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.320050Z","title":"Hash layers for large sparse models","venue":null,"work_id":"12cfde79-6788-43bc-8163-759fd3d3c0fa","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:2d48ab10610ab7198e9a04936fc2354720427ad7e73778521a1c02ad957dc4fb","observation_id":"b7899cb2-a85c-438f-9a69-eea508631924","resolution":{"observed_at":"2026-07-11T03:27:49.337262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.616003Z","title":"WinoGrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106","venue":null,"work_id":"243059f7-4536-48b2-bf09-64ac04da23b9","year":2021},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:5ec6c6c0151dcccdb2df7d86008a48f0c7ae302b45c82f626838dc8107bafe5b","observation_id":"a3f626d7-f5e9-4783-a00a-1bdfc5dcd1c3","resolution":{"observed_at":"2026-07-11T03:27:49.640514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.488114Z","title":"Confident adaptive language modeling","venue":null,"work_id":"79b94827-7379-413c-a81e-f6102c3437fd","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:e15c14d34efc29e22104edac1a1ff16ecbf46e42aa4f75eaaa881e4a26de8d95","observation_id":"d366ebe4-852a-4557-976f-5bacdf5bb857","resolution":{"observed_at":"2026-07-11T03:27:49.515000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:f89aede0d6c5378dc31f9a4425ce51cd5f772caa86ed1d354eaac115885088d5","observation_id":"93ad1f44-0cdb-4b4e-828a-69cb4bd8bb58","resolution":{"observed_at":"2026-07-11T03:27:46.805207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:d5a218c72e758eefad8b790006499ee5c1a270b53178d023fd8e7fdd281dd12c","observation_id":"98fa3c18-b935-48db-8bdb-833a3b0cd04e","resolution":{"observed_at":"2026-07-11T03:27:46.780834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.517843Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"d0219ce8-cd4a-40a6-8a52-b40dc71b1004","year":2017},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:c6796d76ba16952d7b3af0bcd47ffdf56d30021a8d376dda61bcba83b65bb7ec","observation_id":"252b5bfc-ac9d-4412-a291-f49745633493","resolution":{"observed_at":"2026-07-11T03:27:49.540517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.591479Z","title":"RoFormer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"d7e0bbe5-80f8-403b-97a4-92e0adb57f28","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:d17f72d762e57175169f02a194067bd7dab629f7c06d14a7908066602976cc0c","observation_id":"df4ee790-2647-4e2a-9d75-146d73252b30","resolution":{"observed_at":"2026-07-11T03:27:49.613213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.780233Z","title":"Adaptive attention span in transformers","venue":null,"work_id":"3643dba3-482e-49a5-9a2d-a4143ab51739","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:67d67c1eba2b679a78a95b73b2f0832e3e40da0a6fac75ecf8d50a0f115b02f8","observation_id":"db412bd9-19d0-4b06-910b-a2f04c56fb64","resolution":{"observed_at":"2026-07-11T03:27:49.803006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.364389Z","title":"RedPajama: An open source recipe to reproduce LLaMA training dataset","venue":null,"work_id":"89a8f043-3dd3-435e-b70a-4ae9a4a9c466","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:db808360d519ca7916b356e2212ea5103c6ef348a38c0394eb3939f8fdb693bc","observation_id":"b05a2f47-3dca-4638-80a6-e14c5c59f5de","resolution":{"observed_at":"2026-07-11T03:27:49.386197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.097604Z","title":"Williams","venue":null,"work_id":"7ce1f972-bcb3-4762-9019-4cb3501b3719","year":1992},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:e8f437ba50b914e7d10fe6b55cda1eae8825e4bdd58eaf3fb05e8dbd9cd73156","observation_id":"591d3d97-a3bc-40a2-a3f8-184120383b4d","resolution":{"observed_at":"2026-07-11T03:27:50.130733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:50.067047Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"153fd63e-49a6-41a2-ae73-882541c89257","year":2024},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:a351da1531e5905159afdd6e27e82fb197066c7b14451acba15878ae3c8d379a","observation_id":"e4dc1fcc-2c38-4d1c-adc2-fb6971e3ef57","resolution":{"observed_at":"2026-07-11T03:27:50.093759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.688094Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"3fab7912-1367-42b0-b545-9f5b76e989df","year":2020},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:c448233e4bf56d8d1eef1c1904b3ec4ceb5a27b490d9db676961fb1c1acc7637","observation_id":"1c4f6a4c-4090-4364-94fe-a5ab1d4e26e5","resolution":{"observed_at":"2026-07-11T03:27:49.705698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.389652Z","title":"HellaSwag: Can a machine really finish your sentence? InAssociation for Computational Linguistics (ACL), 2019","venue":null,"work_id":"39a5ea55-f4eb-4662-ab0f-9385ad2aadf9","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:815968ec39de7ff4d1f2d7358ebb053089fb03fcc0f4ad7ed7f989595d9fe31d","observation_id":"94cf9ac2-63a2-4f92-93bf-5a894983ab02","resolution":{"observed_at":"2026-07-11T03:27:49.411597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.643680Z","title":"Root mean square layer normalization","venue":null,"work_id":"1e385089-b59f-4336-9fa1-8c58c216a921","year":2019},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:e8e6fbef91c109d9fdc32ae040eee796ab9318d95ab971add8a1297d9f97ff07","observation_id":"0e15645e-fb27-4c74-b7ed-9562502f5ce2","resolution":{"observed_at":"2026-07-11T03:27:49.664028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.667052Z","title":"Mixture of attention heads: Selecting attention heads per token","venue":null,"work_id":"86fb5f3c-8e22-48d0-9504-2506d33f881f","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:e36f80a90a9c18a1e9eda0083dc2ce726993bb2709cab5c3066b2bcef00dbeaf","observation_id":"1bbaa7e6-ed5d-4778-b9a0-4476bc91cad6","resolution":{"observed_at":"2026-07-11T03:27:49.684979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.708611Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"bfb332dd-b361-4b48-8344-2a3bb200d983","year":2023},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:dd20551c8d4e93fefd61b02f3cd966b289503ab54b6a12482746def456f36306","observation_id":"e8afb211-eee2-4214-a981-7b401ce35bd6","resolution":{"observed_at":"2026-07-11T03:27:49.728178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.732117Z","title":"Dai, Zhifeng Chen, Quoc V","venue":null,"work_id":"a2b130d8-d6f5-4c7c-ae43-8be73985fcee","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:f32b1ca78a00f3055543f72cfce667b7089f936bdc10f8d68ae7129a4bc6cea7","observation_id":"190c1693-34d1-4084-aae5-d3ebda45542e","resolution":{"observed_at":"2026-07-11T03:27:49.751235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:c3183cd5082742c9def93590995757be7b6c3e0277194296bf902b8c7f357962","observation_id":"a43205cb-f2bf-4834-9110-62da85b0a662","resolution":{"observed_at":"2026-07-11T03:27:46.886389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T05:56:10.563626Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":39},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.06601."}