{"as_of":"2026-08-10T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15662377e6485c9f6d3deed8be79169bc8a6441b6743ef640692c343442c3aec","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:40:56.623496Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02040/citation-record","integrity":"/paper/2502.02040/integrity","json":"/paper/2502.02040/citation-record.json","paper":"/paper/2502.02040"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.328331Z","title":"Phi-3 technical report: A highly capable language model locally on your phone, 2024","venue":null,"work_id":"4455c8bf-d4bd-4332-9f0f-de9cd69165d4","year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.383105Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:0e39fc8a43fb8d2b499ec0ab9ab96747aa147ee6f5d21b5db692c85c029784e0","observation_id":"4125d7d7-4910-4038-a307-f73154be051b","resolution":{"observed_at":"2026-08-09T13:40:57.331392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.318343Z","title":"Llm inference performance engineering: Best practices., 2023","venue":null,"work_id":"991b4793-8de8-4b80-9b26-6a3914576908","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.386863Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:b8265d96945813e2d9ef6f69cad1ce50172511336e1826cffe9323e36088c2ba","observation_id":"d0f03468-926a-41b4-8a48-0838424117a1","resolution":{"observed_at":"2026-08-09T13:40:57.322083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-09T13:40:56.390827Z","title":"Gkd: Generalized knowledge distillation for auto-regressive sequence models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.390827Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:113d6bfdb5a7c41a09f5f5e32af3dc191f94df7813e5945414ce0d2da1f498ab","observation_id":"71a53602-126b-415c-b675-abe2ed4fdebc","resolution":{"observed_at":"2026-08-09T13:40:56.390827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.308400Z","title":"Colt5: Faster long-range transformers with conditional computation","venue":null,"work_id":"506fa17b-edf8-4afd-9141-f9aef9933005","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.394133Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:16ae1257ef419e4466126f0b50b2545edf7fba9efcadcdf415aeeff996985046","observation_id":"0fd5c2b9-a9c3-4750-aed2-84c18df135ad","resolution":{"observed_at":"2026-08-09T13:40:57.311780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.298881Z","title":"Hydra: Sequentially-dependent draft heads for medusa de- coding, 2024","venue":null,"work_id":"f8334492-a7e1-43fe-8499-d1b526c4e98e","year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.397230Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:87a47e2761b5879dfde3d69faf4e584c7072d9fefc8f647843e614c323f716cf","observation_id":"ba66cd9e-843e-44c9-bdbe-c1c10b38aae4","resolution":{"observed_at":"2026-08-09T13:40:57.302208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.289140Z","title":"Massively multilingual sentence embeddings for zero- shot cross-lingual transfer and beyond","venue":null,"work_id":"5ffc07fc-0217-4ce2-a938-054927b8cf66","year":2019},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.400215Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:2467cf3ed0bab141e15edfbab5d940b6df1f14ba2aca941cb3b5ef1d78ccfcf0","observation_id":"6d74ad29-afe5-4099-95e7-84ca590ae6c9","resolution":{"observed_at":"2026-08-09T13:40:57.292785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.280132Z","title":null,"venue":null,"work_id":"2fc6f6f7-5d1f-4805-b195-97faa37db0f4","year":2016},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.403333Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:57e2ae56b06b40767c5d639c8bed70595f499acef027301a6eac2ac4cebb687a","observation_id":"41fab238-730c-4342-91a8-007410e1ba14","resolution":{"observed_at":"2026-08-09T13:40:57.283289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.270076Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":"2d9eb9fe-c99e-4eda-8b85-8589a165241a","year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.406063Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:3118a5426a88d2bc870f421b6790da9173e293d2e873d7c7970daf1447a98565","observation_id":"b7497dd7-1fc9-440e-a26d-dc0aaff5af52","resolution":{"observed_at":"2026-08-09T13:40:57.273661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11131","last_updated":"2024-02-16T23:36:43Z","snapshot_observed_at":"2026-07-06T17:31:29.199601Z","submitted_at":"2024-02-16T23:36:43Z","title":"Speculative Streaming: Fast LLM Inference without Auxiliary Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11131","snapshot_observed_at":"2026-08-09T13:40:56.409002Z","title":"Speculative streaming: Fast llm inference without auxiliary models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.409002Z"},"links":{"cited_paper":"/paper/2402.11131","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:19fd203d088b8738829dc6b3f9a3b88039d1eb4c9174cd5651011ca23cdf24c8","observation_id":"0d7e73a3-b19b-4020-8b21-4c906ee9a86a","resolution":{"observed_at":"2026-08-09T13:40:56.409002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.412320Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.412320Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:29cf8744cd31a9f53adff88537b1721ca38a739976a8ff4913ec132b457ab523","observation_id":"0fd1e4e1-0fe1-44e3-ab53-3f16e10cdc7f","resolution":{"observed_at":"2026-08-09T13:40:56.412320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.254631Z","title":"Medusa: Simple framework for accelerating llm generation with multiple decoding heads","venue":null,"work_id":"3c0d7646-d48b-440c-8fae-69d342afe821","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.415675Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:6d2afc28ad4cdff88534a4a899cc4063be80463dd629d9dcbfeae71edc059e9d","observation_id":"4303cf81-200f-4f73-b870-0c06615b8231","resolution":{"observed_at":"2026-08-09T13:40:57.258058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-09T13:40:56.418582Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.418582Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:c7df65470e45dca9aca7497fe1c8bbb434ad3e49b2c885ecf2611d820c829d2a","observation_id":"aac75849-a2df-4b96-a798-56abaf1bfb20","resolution":{"observed_at":"2026-08-09T13:40:56.418582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04916","last_updated":"2024-06-16T08:37:25Z","snapshot_observed_at":"2026-07-06T16:58:43.934362Z","submitted_at":"2023-12-08T09:31:50Z","title":"EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D Parallelism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04916","snapshot_observed_at":"2026-08-09T13:40:56.421746Z","title":"EE-LLM: Large-scale training and inference of early-exit large language models with 3d parallelism","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.421746Z"},"links":{"cited_paper":"/paper/2312.04916","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:135eafe4ac4881fb7d10615f7dc37e525924312477a85cdebc9b04e65cbfa94d","observation_id":"130c8be1-1ea0-485f-89b6-1dc16780f1fd","resolution":{"observed_at":"2026-08-09T13:40:56.421746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.245149Z","title":"DialogSum: A real-life scenario dialogue summarization dataset","venue":null,"work_id":"4193ea1f-9f50-45b4-80e7-2a32322f0bf8","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.425216Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:b618d1811415880c0ba1e208fb721ccdd2df6d5112e5d99b369ec4062a361a68","observation_id":"8ac1876a-3b63-4d21-a25c-97cf08a7e166","resolution":{"observed_at":"2026-08-09T13:40:57.248545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.235821Z","title":"Koala instruction set documentation, 2023","venue":null,"work_id":"62fa7ea1-cbc6-493f-8502-eb87482ffc3d","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.428185Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:07d1d0e4effd004fa04e9ffc81594a7d9fd2e1eaa5614a6420a300bbf4ab9771","observation_id":"21915d66-c976-49e7-91c7-a3ebf8c8865f","resolution":{"observed_at":"2026-08-09T13:40:57.239004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.226141Z","title":"Dai and C","venue":null,"work_id":"787549d8-426f-414b-b407-b16bc4224872","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.431458Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:646177339a18018372e4cb7cff25350a4adb24e457d86db0408b727265965965","observation_id":"227accd1-0895-45b8-bca0-66d1ef3531a3","resolution":{"observed_at":"2026-08-09T13:40:57.229623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-07-06T15:50:49.116859Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-09T13:40:56.434433Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient llm inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.434433Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:dbad74f72489def64552b0e8e08a20e5a30fb94de03bd83a1a095d9a3934e676","observation_id":"e26b19c1-73ca-4a02-901d-1d9b158496c8","resolution":{"observed_at":"2026-08-09T13:40:56.434433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-08T23:08:43.190961Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-09T13:40:56.437585Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.437585Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:09a841150e51cef8d6972902b4a612158b2cef24a7f06ae5383798a51b2247f6","observation_id":"e41a4539-c671-4783-bc6a-9b7406b46111","resolution":{"observed_at":"2026-08-09T13:40:56.437585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-09T13:40:56.440954Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.440954Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:374ea653bb85c7c2533983ea81b979e3b752409bc45200ab6177034aa63822cd","observation_id":"f6e487e9-a792-4216-8855-6e30d3dee94a","resolution":{"observed_at":"2026-08-09T13:40:56.440954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.215587Z","title":"Evaluating the State-of-the-Art of End-to-End Natural Language Generation: The E2E NLG Challenge","venue":null,"work_id":"b58dc088-0d7f-42e1-8c31-9c060aa47613","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.443911Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:1165b77eee4ef3d8ba806e4d40421af3e50f929fcf9b489bbff9aa7490df0757","observation_id":"160c048d-2e2c-45f4-b846-0c76eae1e813","resolution":{"observed_at":"2026-08-09T13:40:57.219584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.206591Z","title":"Depth-adaptive transformer","venue":null,"work_id":"f5e93740-c910-4c69-80c6-ae5dd41524e2","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.446767Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:91ed40f5f5d7e4b0913500b4ee6462da29deaa9da0952bc996ac25d6c8e812fc","observation_id":"609d15ac-e549-4076-9b5a-8e8fab22c3dc","resolution":{"observed_at":"2026-08-09T13:40:57.209682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04685","last_updated":"2022-12-28T11:22:40Z","snapshot_observed_at":"2026-08-05T13:39:36.359516Z","submitted_at":"2022-06-09T04:13:55Z","title":"Predictive Exit: Prediction of Fine-Grained Early Exits for Computation- and Energy-Efficient Inference","version":2},"cited_work":{"arxiv_id":"2206.04685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.04685","snapshot_observed_at":"2026-08-09T13:40:56.801527Z","title":"Predictive Exit: Prediction of Fine-Grained Early Exits for Computation- and Energy-Efficient Inference","venue":"cs.LG","work_id":"19ae9681-9c95-4033-acf1-f94803f2fa99","year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.450038Z"},"links":{"cited_paper":"/paper/2206.04685","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:ac73f3c7d1e4dbb4ae718b4c77c464ae87870102d596bb9b15ac266af604c164","observation_id":"f0c36f0c-7c4e-4754-bc62-a18a23bbc08f","resolution":{"observed_at":"2026-08-09T13:40:56.806396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.197224Z","title":"Decoupled early time series classification using varied-length feature augmentation and gradient projection technique","venue":null,"work_id":"2404d80c-761c-41b5-8594-9a8c6bc0cf05","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.453137Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:8830a41308400f2f6d62c3269a5b7dae93d1712e63f3393c7aba389cc4b8cc55","observation_id":"f9c0b924-8153-49ff-ba7b-e93db0e1bb26","resolution":{"observed_at":"2026-08-09T13:40:57.200580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.188101Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"31f5920b-6aa6-4541-b8f3-cd6d5a7a9bb5","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.456254Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:61e3762591e235baa4f1a07a60eabc5b7dad66b246fcd9470c5a05475f30ef79","observation_id":"7084d49a-8e22-478c-a066-6a00445acd05","resolution":{"observed_at":"2026-08-09T13:40:57.191175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.178754Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"b2a2a247-54f7-47cb-9ff0-ebd49775fa09","year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.459296Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:79431f792d8378534b6dc563f459b1e05bc99d64f9ebc62f77dafe08c63e2a84","observation_id":"4431a023-fc9e-4a15-b5d5-2dcf933839a3","resolution":{"observed_at":"2026-08-09T13:40:57.182197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.462238Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.462238Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:dc6ef85e76fc3660de3e789534519563ee5bf76d72280f6ee977818dda7830c7","observation_id":"1b7f3946-3ba4-45cb-9ffe-e1ee086430ec","resolution":{"observed_at":"2026-08-09T13:40:56.462238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-09T13:40:56.465244Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.465244Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:4c17500ddd678d2fb02512ee22ea9a878585b8e759225588432c3c5dcba39204","observation_id":"6bb98c18-d580-4034-8917-807fbbb8ad18","resolution":{"observed_at":"2026-08-09T13:40:56.465244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.162747Z","title":"Breaking the sequential dependency of llm inference using lookahead decoding, November 2023","venue":null,"work_id":"c88f68d2-b284-4f87-a3db-1f598ed31dc1","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.468436Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:caffb3eabb6ae3bd150fd4f3bedb82016be2b0b3611ae49f1f37691b7346288d","observation_id":"5d4d0187-f8ff-4d4b-b8aa-da7a922e888a","resolution":{"observed_at":"2026-08-09T13:40:57.166407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.153159Z","title":"Garncarek and J","venue":null,"work_id":"79a3867b-ffc4-4bba-985b-fd5d02754d40","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.471577Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:e68f1c85d194ad8cc0b1e28fd655e559044d5382593323452f96e8b745251add","observation_id":"4aa6fb13-2c4e-41b8-aacc-e8cb3ca8c476","resolution":{"observed_at":"2026-08-09T13:40:57.156345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.143136Z","title":"Koala: Dialogue-based fine-tuning improves factuality and safety of llms","venue":null,"work_id":"33a5dda0-7e38-4619-bc4c-32b22519e445","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.474505Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:a1b0f9b045bbc8947494a145f715aea167ec06e5f0e1123626b354b17c2a57d6","observation_id":"ecfd5849-273a-42c5-98b4-890529b78c3a","resolution":{"observed_at":"2026-08-09T13:40:57.146814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-09T13:40:56.477410Z","title":"Knowledge distillation of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.477410Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:0e9303607be41f6ea2a56ed6797e2ec23b0b8e2894fb350a3d50b0b3c110d82c","observation_id":"85ed8cbd-fb4c-4221-b2c5-350088de0f74","resolution":{"observed_at":"2026-08-09T13:40:56.477410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.133416Z","title":"Identity mappings in deep residual networks","venue":null,"work_id":"e469991d-8cdd-4927-a5bb-e30c34b5318d","year":2016},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.480814Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:5bd99e1add9ca10e29bebca95f70c422ec57424ac2223380666e6cce2c390318","observation_id":"bca9d024-aab7-43b6-9906-3b91c0ed9afd","resolution":{"observed_at":"2026-08-09T13:40:57.136782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.123769Z","title":"Dynabert: dynamic bert with adaptive width and depth","venue":null,"work_id":"efba0ca5-07b3-4fad-8fd8-517448a6ff72","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.484066Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:4e591f093ba909283123b3758621db90791c7d8b035b8dec549576b47dad195b","observation_id":"26d78d7a-9e40-4440-85c6-0dca8b7a41ed","resolution":{"observed_at":"2026-08-09T13:40:57.127174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.114072Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":"a382069c-f97c-44bc-aa93-56862e421946","year":1991},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.487126Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:af9914ccf38080f7617319b38c871a6e1425cc958891996ec15f1f3063e51c28","observation_id":"faac1eb5-92f3-46ec-9546-12b43bf53dec","resolution":{"observed_at":"2026-08-09T13:40:57.117441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T13:40:56.490622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.490622Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:007a8d4bbc98c7356877c2b5688160f199a3bdb6a6fcaff438a52de25faef987","observation_id":"9f701b72-db33-40fa-87e4-9b0568cc5a4c","resolution":{"observed_at":"2026-08-09T13:40:56.490622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.103949Z","title":"Hierarchical mixtures of experts and the em algorithm","venue":null,"work_id":"1d81f7ea-ff10-41e8-a9d3-8de4c5d52f04","year":1994},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.494312Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:f0211386029143b35c7f3f5605eeb4fddde4b61917199d128ab32745dd3e7e05","observation_id":"b1bca0b5-6a53-4789-89b7-97a58e7df821","resolution":{"observed_at":"2026-08-09T13:40:57.107682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.093647Z","title":"Ten lessons from three generations shaped google’s tpuv4i","venue":null,"work_id":"35e10af7-df77-482b-9274-dba67fed6a28","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.497877Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:939abe7e9c9a0b51238e5c93be216a4daa66e88e5cf662da23b1b52cd93485bc","observation_id":"8fdaa0e2-c1c9-4eea-b6c6-0c14f2a38fa0","resolution":{"observed_at":"2026-08-09T13:40:57.097080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.083526Z","title":"In-datacenter performance analysis of a tensor processing unit","venue":null,"work_id":"6f1e4e06-f0f7-4123-bd64-446ba901f521","year":2017},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.501446Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:451c464266d434e8c04a5c7a702d312d17913fd588fc3265937c17b79947d9c6","observation_id":"5e1ca558-39b8-43f0-b235-0172eaaed0ea","resolution":{"observed_at":"2026-08-09T13:40:57.087012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.073470Z","title":"Gpus and the future of parallel computing","venue":null,"work_id":"9ccc19f5-7dc4-4a7b-b363-bcb55a8cac47","year":2011},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.504762Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:3828b562df5d5f311e91fafeafffe6598b3efd2a722c4d4b9cb8e3a64476c0de","observation_id":"1e7dd89a-5e9b-4a86-9cba-04cb45604405","resolution":{"observed_at":"2026-08-09T13:40:57.076898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.063262Z","title":"Ai and machine learning acceleration in mobile devices: A survey of architectures, hardware, and algorithms","venue":null,"work_id":"1b98e4ac-1ab5-48e6-b824-f456f806579f","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.508416Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:6079757b382dff87ae45d0f8fe8706dd7cfe68beec176511252aaf137e8076a5","observation_id":"1fe90847-784b-4f93-afd3-b61115c1f186","resolution":{"observed_at":"2026-08-09T13:40:57.067134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-09T13:40:56.512100Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.512100Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:77807d914260a5795634c284f7b5a2994c05a5010ba2aa4dcae67af4ce27bfdb","observation_id":"178775d1-af33-4df4-9fab-7f32a86e552a","resolution":{"observed_at":"2026-08-09T13:40:56.512100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.053708Z","title":"GShard: Scaling Giant Models with Condi- tional Computation and Automatic Sharding","venue":null,"work_id":"15c70485-1bb0-4ff7-8514-4f674f1947f7","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.515875Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:b63fee2c6d07b32075d20ea9a88edadd11067dfa03fde272db81ad66e235182e","observation_id":"c83a3b46-ca25-44a7-89b4-fdadeadc8250","resolution":{"observed_at":"2026-08-09T13:40:57.056698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.519530Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.519530Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:348674aa897340bf0fd1e78101d65a8bb2b3f706b96bd186b5afd28d56b7d623","observation_id":"bf0974c2-d4f8-4464-b951-dc8ea5df6241","resolution":{"observed_at":"2026-08-09T13:40:56.519530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-09T13:40:56.523044Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.523044Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:22d2df6d3d7d35e2885c5084a5a181c4c6720352794d84b61127faf9ac62611c","observation_id":"a989bc8e-992a-4d64-9e55-4178ae7d21e2","resolution":{"observed_at":"2026-08-09T13:40:56.523044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09781","last_updated":"2024-04-01T02:18:42Z","snapshot_observed_at":"2026-07-06T15:28:24.682211Z","submitted_at":"2023-05-16T20:12:59Z","title":"SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09781","snapshot_observed_at":"2026-08-09T13:40:56.526776Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.526776Z"},"links":{"cited_paper":"/paper/2305.09781","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:d4dc18ecd0f7ea5de1b96ca8b22800ac6414b5ae833aa260d8e7f8717960b070","observation_id":"a7e6870a-1e77-4fe2-9c32-194f4a17984c","resolution":{"observed_at":"2026-08-09T13:40:56.526776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-09T13:40:56.530396Z","title":"Smith, Pang Wei Koh, Amanpreet Singh, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.530396Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:0abb562935b323c65916a84191a9a95ec9db847b8283e4f30ea3e12833bc302a","observation_id":"a878b6c1-c1d3-4107-8066-86a96b964406","resolution":{"observed_at":"2026-08-09T13:40:56.530396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.038115Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"24dcfda9-44db-46e8-acb8-c5607c0798f3","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.533930Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:095fbce9f8c28549f5ec06cbe68f3b6e230e5f015df64d1f692669e496dc718e","observation_id":"7c104600-4e33-4238-8012-774f324cb833","resolution":{"observed_at":"2026-08-09T13:40:57.041818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.029397Z","title":"Cuda c++ programming guide, 2021","venue":null,"work_id":"23dd96e6-70f4-4f4e-9621-a2765d37b917","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.536413Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:cff455b96d91f8d2ef7374eb14af7980e6746b0bee862e9ce45869a98db9d7b1","observation_id":"f9aa0612-9a4f-46d0-9529-450ac437ab24","resolution":{"observed_at":"2026-08-09T13:40:57.032278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.538683Z","title":"GPT-4 Technical Report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.538683Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:06f6085dccb04edec002dd13a19372748eafe50fb616ace27994b4e4405bbb37","observation_id":"6e7f2e82-0775-4321-b5de-c29ebf5ee8af","resolution":{"observed_at":"2026-08-09T13:40:56.538683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.013329Z","title":"Language models are unsupervised multitask learners, 2019","venue":null,"work_id":"594d2ccb-13ac-4a97-881f-6ac52a43205d","year":2019},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.541014Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:6590496943a876d6552517d2e87eca755368da91bef13787c827128b229136dd","observation_id":"eaa65c5c-e415-45b0-a151-d99761e0f97d","resolution":{"observed_at":"2026-08-09T13:40:57.016826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-09T13:40:56.543541Z","title":"Lillicrap, Peter Humphreys, and Adam Santoro","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.543541Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:63122b950099c7e0f2dae694a1721c2be4f9973e1798db9237c80a6cdf4f41ce","observation_id":"4b394c27-284a-410a-9876-ede0ab73677d","resolution":{"observed_at":"2026-08-09T13:40:56.543541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-09T13:40:56.546001Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.546001Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:1807ca14fb3326779b559c2dea74c7f24763115e24a9e28e13bbd24dda8376da","observation_id":"9ba1dab6-d238-47d8-b6e7-397f3f7d009d","resolution":{"observed_at":"2026-08-09T13:40:56.546001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:57.002275Z","title":"Tran, Yi Tay, and Donald Metzler","venue":null,"work_id":"828487a5-57c4-45da-953e-943aec61512d","year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.548559Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:a85be846513ec998f81e985c9a0eaa13c80708e1915427e0d0b1be52499dd3a9","observation_id":"99140b0c-0b9b-45c6-bccf-dd6f79f30650","resolution":{"observed_at":"2026-08-09T13:40:57.006694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-09T13:40:56.551350Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.551350Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:8e2a43b2324598b951b4999f9a8e729f30042255e2d12637e7dcea59325b0f6d","observation_id":"fc8612f8-4408-4a35-ba5e-20b685fb18db","resolution":{"observed_at":"2026-08-09T13:40:56.551350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.991668Z","title":null,"venue":null,"work_id":"0150affd-2d00-4e4f-b2c6-d919a34ce4c1","year":2021},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.555030Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:c9f0621e1c51bd3f79ff77379b89586944334a2d4486814244eda5f1c7b65ba2","observation_id":"82d54c11-66cc-49ee-b739-1d0bc93339bc","resolution":{"observed_at":"2026-08-09T13:40:56.995345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-09T13:40:56.558179Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.558179Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:a19a6a3d90c83b8cb6b086d29aa8fab0697617761b36fa70774e5bc5cef0155b","observation_id":"88d5c12a-7214-4143-a264-5035e6bc7063","resolution":{"observed_at":"2026-08-09T13:40:56.558179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04623","last_updated":"2023-08-08T23:29:55Z","snapshot_observed_at":"2026-08-09T22:39:17.904880Z","submitted_at":"2023-08-08T23:29:55Z","title":"Accelerating LLM Inference with Staged Speculative Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04623","snapshot_observed_at":"2026-08-09T13:40:56.561768Z","title":"Accelerating llm inference with staged speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.561768Z"},"links":{"cited_paper":"/paper/2308.04623","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:3be30cbdc6117f05ebb93537ed7712f57fa170267f63304ac38550950c9a1144","observation_id":"f77c6337-9423-4108-8396-e2ff63b2e4f7","resolution":{"observed_at":"2026-08-09T13:40:56.561768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-09T13:40:56.565238Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.565238Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:28c8e205a055da3a3baf53ab304861c82557edb76c066d1bc33d92b0160af24c","observation_id":"8082d3ff-2a22-46ec-b727-441fb821c775","resolution":{"observed_at":"2026-08-09T13:40:56.565238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.981836Z","title":"Manmatha","venue":null,"work_id":"8574df17-9d2c-4734-a1b8-fcb0937df0f7","year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.569007Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:bdaf7dfd7496193058569286930734f859b45ef7b9b9946196fc729c87f8dc0b","observation_id":"204e7fcc-a2aa-4a6b-a5f9-999fb832453c","resolution":{"observed_at":"2026-08-09T13:40:56.985328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.972081Z","title":"Tuan Pham, S","venue":null,"work_id":"1e2fa176-311a-435b-9d31-360d954b3a03","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.572295Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:fb128313ee815dde252fe63714f4275ea6343748325e233756c5cf790663b5bd","observation_id":"aab5ecd6-5ddd-4812-9a99-a9d0e01cbdea","resolution":{"observed_at":"2026-08-09T13:40:56.975515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.962253Z","title":"Model cascading: Towards jointly improving efficiency and accuracy of nlp systems","venue":null,"work_id":"2b44dab3-794a-4ea7-b8c1-c46646b1b5ad","year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.575573Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:4c0b8f5acb951e353d648ef0812fdef60c1e97a8b2e6963e838bd70ee7c66faa","observation_id":"3340cb68-c9a3-433b-ac70-c5a9fc519aa3","resolution":{"observed_at":"2026-08-09T13:40:56.965723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.952181Z","title":"Investigating acceleration of LLaMA inference by enabling intermediate layer decoding via instruction tuning with ‘lite’","venue":null,"work_id":"b5147f64-64e8-4b5b-a701-06ea48238295","year":2024},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.578809Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:56c487cee0cad4ff086b527aeb451a9d802cbe90cf3fff2b4d975b4bc69c12a8","observation_id":"a84b56e0-c4d7-43ac-9b3e-6fa0effefe23","resolution":{"observed_at":"2026-08-09T13:40:56.955798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.581952Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.581952Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:00d44729abb2f5574066cf6f7e22a816fe796beb292a0b68cd52b1a9750b14a5","observation_id":"eaccb3ce-68cd-4c3f-86a9-c4aa429352f3","resolution":{"observed_at":"2026-08-09T13:40:56.581952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-09T13:40:56.585245Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.585245Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:a8503d254d949381101f02ff009663ecfb252a87d7ad8cd73ff802cd8d508487","observation_id":"941f8570-0355-4682-9b53-c23bb9ffce91","resolution":{"observed_at":"2026-08-09T13:40:56.585245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.936809Z","title":"Transformers: State-of-the-art natural language processing, 2020","venue":null,"work_id":"b6fa319f-041d-48f4-a548-8d27caf398ad","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.588725Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:f4159b4d90c6e83dbb985e31685fd9be0c283e7069d6568ad6389d296aed36c5","observation_id":"eb6434e6-a44b-44f0-8041-5c12645a8b5f","resolution":{"observed_at":"2026-08-09T13:40:56.940331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.926934Z","title":"Speculative decoding: Lossless speedup of autoregressive translation, 2023","venue":null,"work_id":"ecda23d9-49dc-4ad9-afbe-27f853e63aec","year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.591822Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:b0ffa1a9ed2c7ee467042305a27893b39c50d833032f44aee0908d4ddeb2ed7c","observation_id":"f6407729-53b6-45dd-acbe-16cf625e36cf","resolution":{"observed_at":"2026-08-09T13:40:56.930511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.916119Z","title":"Deebert: Dynamic early exiting for accelerating bert inference","venue":null,"work_id":"40108552-43bd-417c-90e9-9314447198fe","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.595373Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:397d4c1819a5bb48e0fefe3044d41c6d7cc3a15d17c0521253b4d9b235af519f","observation_id":"09a028c5-939f-4d78-ba5c-e2473c964c4d","resolution":{"observed_at":"2026-08-09T13:40:56.920409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-10T07:58:15.209421Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-09T13:40:56.598812Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.598812Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:dd674185d72bbeb378a49f93b1b4e47b4965af89bd356b1d6f59e603b9351b34","observation_id":"772efeba-ed59-4ef5-a62b-88fe4ebbe676","resolution":{"observed_at":"2026-08-09T13:40:56.598812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.906191Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"85564776-d7ce-476c-8496-566f53e64099","year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.602300Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:96d2ce04802f51be82c304fbf01f196dd302cd6dee58dd7bc42bd8110e698700","observation_id":"a3788be9-4e4b-4053-ad3c-d74088f4b257","resolution":{"observed_at":"2026-08-09T13:40:56.909812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08887","last_updated":"2019-02-02T23:53:18Z","snapshot_observed_at":"2026-07-06T07:03:52.901427Z","submitted_at":"2018-09-24T13:03:13Z","title":"Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.08887","snapshot_observed_at":"2026-08-09T13:40:56.605732Z","title":"Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.605732Z"},"links":{"cited_paper":"/paper/1809.08887","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:b7cfe9a84286d25cddbb3d2abe2df9e0e8ae5b7a0d6a0cde2d9dda7ad2e709f4","observation_id":"350e3e94-af68-4af6-9d1a-37eba339cc6f","resolution":{"observed_at":"2026-08-09T13:40:56.605732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.609457Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.609457Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:1c1c84964ba8dadb320dc42b934b493b561f86e98a3a188b94ef1aab52808b83","observation_id":"e22e5582-7e5d-45ca-aeec-b77e78ccb127","resolution":{"observed_at":"2026-08-09T13:40:56.609457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-03T05:45:09.122112Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-09T13:40:56.612810Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.612810Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:656fb8c48e02a8243bd099eb3680f8f02914e6eb24f7526f5348682c349bcfa5","observation_id":"334aef28-f2e3-4be0-b144-280af8aee97c","resolution":{"observed_at":"2026-08-09T13:40:56.612810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.889972Z","title":"Zhou and et al","venue":null,"work_id":"e8c7e9f9-eb6c-454b-bceb-9677b7937cff","year":2020},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.616348Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:a0cb26fcc41308d75a609e31f91c4decceb6403e89b1219d09d0bd0acca4fc7a","observation_id":"da1245c6-485f-4294-88a2-171311cd026f","resolution":{"observed_at":"2026-08-09T13:40:56.893641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.880756Z","title":"Designing efficient sparse expert models","venue":null,"work_id":"e7332e0b-7c07-4662-8858-12955a61dde8","year":2022},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.619675Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:fdd24049ae47c3e43e49f5447503788bc138962461f6f66bc8a897bd9ea4a5ca","observation_id":"e687d854-34be-4b62-9d06-1176b7fdb6f1","resolution":{"observed_at":"2026-08-09T13:40:56.883584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:40:56.872018Z","title":null,"venue":null,"work_id":"0b0a32b8-b006-4940-8247-eb7373b8be63","year":null},"citing_paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T13:40:56.623496Z"},"links":{"citing_paper":"/paper/2502.02040"},"observation_digest":"sha256:2e41ea6d8517e7c997eedcd507dd53711472428facbc72ae68e6b00fd30488d0","observation_id":"f72b9031-d6d4-4fbb-9136-bdaa7c543a1b","resolution":{"observed_at":"2026-08-09T13:40:56.874916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02040","last_updated":"2025-02-04T06:13:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T14:19:20.730533Z","submitted_at":"2025-02-04T06:13:52Z","title":"M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2502.02040."}