{"as_of":"2026-08-22T11:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e5b53a1af9fcb976f5930edce74dac49056208ded9909c1e01ca00134376fbf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:06.592617Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":57,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-11T06:53:58.960357Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2305.13245"},"observation_digest":"sha256:5831aada9307f5bb4fb11fe312e929040c4ea8e53c19af6de76cdbd1a9247a73","observation_id":"5cdcc096-9464-4c4c-8c12-3d87e1567d38","resolution":{"observed_at":"2026-05-11T06:53:59.470349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-20T16:10:20.713555Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T13:29:53.345251Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2305.14314"},"observation_digest":"sha256:488079a24eec10e844afb843968ff14f3f99002ff9621cb26daed49045a07676","observation_id":"7634cd19-3f13-4289-b6de-630640e8c514","resolution":{"observed_at":"2026-05-11T13:29:53.618992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-20T21:36:51.212852Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:3c186524f5fe9cceefd936f9c3b5041e6b027c7350db71aaf5460ccb1073316a","observation_id":"56958681-84c9-4f80-a94e-4e5c691163df","resolution":{"observed_at":"2026-05-17T18:00:50.145712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:0b3030fdfa97e13baab18acea9ff18d50c3dfa8080735f753a2e7013e8515178","observation_id":"659423ce-ded9-4c05-970b-b38ca297a6d8","resolution":{"observed_at":"2026-05-12T15:03:07.746609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-20T09:03:18.402041Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T00:40:12.924357Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2309.17453"},"observation_digest":"sha256:c245ee84a2697cb5d6bd10f7064102fa8f85f710a53d3e515a683d1bf5893aff","observation_id":"0f66068a-970b-4ac0-9265-9eb03bc23fb4","resolution":{"observed_at":"2026-05-11T00:40:13.346221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T10:36:17.764761Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2401.10774"},"observation_digest":"sha256:2c5ac6e2ac820ffa9d722737d27ec3c64d4ad949be3d9372b7324e44bc95a2c8","observation_id":"c22765bb-c1de-4bf7-a67d-a0434dbcb6bb","resolution":{"observed_at":"2026-05-13T10:36:17.998786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-12T14:35:56.995517Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15102","last_updated":"2025-03-21T15:47:53Z","snapshot_observed_at":"2026-08-12T23:47:27.200157Z","submitted_at":"2024-11-22T18:06:14Z","title":"AttriBoT: A Bag of Tricks for Efficiently Approximating Leave-One-Out Context Attribution","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T14:35:56.995517Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2411.15102"},"observation_digest":"sha256:aed06a0be619b5061e5966ca243bae2f1837b621f02b9554bd69cffd6f0e62f0","observation_id":"905d6d42-0609-497b-9af6-656f9025c5a6","resolution":{"observed_at":"2026-08-12T14:35:56.995517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-12T13:02:19.444236Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16585","last_updated":"2024-11-25T17:15:28Z","snapshot_observed_at":"2026-08-20T11:31:51.162380Z","submitted_at":"2024-11-25T17:15:28Z","title":"MarketGPT: Developing a Pre-trained transformer (GPT) for Modeling Financial Time Series","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:02:19.444236Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2411.16585"},"observation_digest":"sha256:fb2b8cbef8f93889dc29c4f4139a7b58c5779fe724e7a3ce9e428a2537b81718","observation_id":"3c13e79d-6ae7-4f19-9ac2-17fabad089b4","resolution":{"observed_at":"2026-08-12T13:02:19.444236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-11T12:21:38.863523Z","title":"Efficiently Scaling Transformer Inference , November 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-20T04:15:46.585282Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.863523Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:4bdd2aaf54b0f5b36e5edaed1586cf21e1a4e6bdd39d42cbfeca0dda020d7b0b","observation_id":"7e71a091-1a37-45d6-80f0-d925ea1e9ac6","resolution":{"observed_at":"2026-08-11T12:21:38.863523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-10T21:25:41.222232Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04987","last_updated":"2025-05-16T12:32:36Z","snapshot_observed_at":"2026-08-15T18:26:51.078891Z","submitted_at":"2025-01-09T06:00:27Z","title":"TreeKV: Smooth Key-Value Cache Compression with Tree Structures","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:25:41.222232Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2501.04987"},"observation_digest":"sha256:1e18f1efbe2fb29742efae5c0f68ec83cae77220a57d7b0c9580d70ee8b8e934","observation_id":"21a53ee0-b0f2-4a00-9062-ea2bb4d60a09","resolution":{"observed_at":"2026-08-10T21:25:41.222232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-10T14:07:54.856058Z","title":"Efficiently scaling transformer inference, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-18T06:11:38.050155Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.856058Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:b782c0d7108ec75c2bb016e1e2dea6e96153b354080932c784bdc3c55f2995c1","observation_id":"6dfb7b8e-396e-40ef-bcd6-772041024548","resolution":{"observed_at":"2026-08-10T14:07:54.856058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-08T18:41:32.496327Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05610","last_updated":"2025-03-15T09:28:13Z","snapshot_observed_at":"2026-08-17T20:53:08.331206Z","submitted_at":"2025-02-08T15:34:52Z","title":"Towards Sustainable NLP: Insights from Benchmarking Inference Energy in Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T18:41:32.496327Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2502.05610"},"observation_digest":"sha256:8b4392935fccb0fe7bcc7e80c0a35bdb4808650ba810085143e9a24bc4130cf2","observation_id":"eb050189-b395-4a5f-945e-55fd897b7c6e","resolution":{"observed_at":"2026-08-08T18:41:32.496327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2504.10013","last_updated":"2026-05-07T10:54:03Z","snapshot_observed_at":"2026-08-16T19:46:31.946544Z","submitted_at":"2025-04-14T09:17:47Z","title":"Training LLMs on HPC Systems: Best Practices from the OpenGPT-X Project","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T21:04:11.859563Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2504.10013"},"observation_digest":"sha256:3435200d1e95fbc805918f221ec8d3386ca913fc3b89b4b96b37eaa052d37049","observation_id":"cec36e2b-a024-4f18-9252-28b3938dda3a","resolution":{"observed_at":"2026-05-22T21:05:09.567263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-16T12:40:06.592617Z","title":"arXiv:2211.05102 [cs.LG] https: //arxiv.org/abs/2211.05102 Yingge Qu, Tien-Tsin Wong, and Pheng-Ann Heng","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.12240","last_updated":"2025-05-06T15:23:12Z","snapshot_observed_at":"2026-08-21T22:26:06.795061Z","submitted_at":"2025-04-16T16:45:19Z","title":"Cobra: Efficient Line Art COlorization with BRoAder References","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:06.592617Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2504.12240"},"observation_digest":"sha256:11935ecabdf12ec6bdae1775cc5c7c01b62d6cccb4b64dadc42bd1cc7a587458","observation_id":"fa2ce1d6-8417-4827-8db7-a558c0aa6b3a","resolution":{"observed_at":"2026-08-16T12:40:06.592617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-07T14:47:56.481665Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17694","last_updated":"2026-03-28T10:14:51Z","snapshot_observed_at":"2026-08-15T04:43:19.645752Z","submitted_at":"2025-05-23T10:03:28Z","title":"CoDec: Prefix-Shared Decoding Kernel for LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.481665Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2505.17694"},"observation_digest":"sha256:49cc2ced2df1ce7cee365d08164e447b7045e1101b437ecb24728e6febcec097","observation_id":"ce55d1e5-9c2d-4744-b000-1daf1172ee2c","resolution":{"observed_at":"2026-08-07T14:47:56.481665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-07T13:32:31.926378Z","title":"Efficiently scaling transformer inference, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.926378Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:ba7ac882957a8135e167ecc13f90add204bdb0de53910766e2e7b893e66d0d9c","observation_id":"1702db5c-1acd-43d7-b486-f84714a7ed3b","resolution":{"observed_at":"2026-08-07T13:32:31.926378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-15T19:09:04.247876Z","title":"Efficiently Scaling Transformer Inference,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17615","last_updated":"2025-06-21T06:54:52Z","snapshot_observed_at":"2026-08-18T23:00:07.188613Z","submitted_at":"2025-06-21T06:54:52Z","title":"EQuARX: Efficient Quantized AllReduce in XLA for Distributed Machine Learning Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:09:04.247876Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2506.17615"},"observation_digest":"sha256:e03c827e57c604ba7bf2547daf03da1272d0558c68994bbb6ca239ce1a664752","observation_id":"8330db3e-096e-44b8-bfdf-25074bb9cfe1","resolution":{"observed_at":"2026-08-15T19:09:04.247876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-06T22:01:23.701288Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.701288Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:f305c2baad84a579df94f8567fb9704449bfe7c634abb7ceff56106605d6afc8","observation_id":"556c831d-9d4d-4ebb-a79a-5b862a0c33b8","resolution":{"observed_at":"2026-08-06T22:01:23.701288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-06T18:24:52.949143Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08567","last_updated":"2025-08-07T11:18:14Z","snapshot_observed_at":"2026-08-15T23:48:38.088100Z","submitted_at":"2025-07-11T13:11:11Z","title":"AbbIE: Autoregressive Block-Based Iterative Encoder for Efficient Sequence Modeling","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:24:52.949143Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2507.08567"},"observation_digest":"sha256:575870aff0e22dfbdcfc0042c0bc3c60a307af2fcd4c2db70b7a0ef2e481c82d","observation_id":"e7098408-3cbe-4443-87ec-9a16f453c9c8","resolution":{"observed_at":"2026-08-06T18:24:52.949143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-06T17:13:41.039701Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11506","last_updated":"2025-09-08T14:03:34Z","snapshot_observed_at":"2026-08-08T23:13:35.142650Z","submitted_at":"2025-07-15T17:21:31Z","title":"ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:13:41.039701Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2507.11506"},"observation_digest":"sha256:fda4e5c19680c4f9d9d02ca1dcaf1483ffe799ffcc8a57ce0f1cfd45b314e12d","observation_id":"48b0a8f9-3d01-4471-9ddb-e8c340b4c42d","resolution":{"observed_at":"2026-08-06T17:13:41.039701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-06T16:14:22.520713Z","title":"Available: https://arxiv.org/abs/2211.05102","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14392","last_updated":"2025-07-18T22:43:38Z","snapshot_observed_at":"2026-08-16T01:22:42.074100Z","submitted_at":"2025-07-18T22:43:38Z","title":"Characterizing Communication Patterns in Distributed Large Language Model Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:14:22.520713Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2507.14392"},"observation_digest":"sha256:798764b2eb4f8508f87f0f1c3e146c2dbdad7dcea8b94a9d803a02e3b932dcf3","observation_id":"8b7f616e-de53-44e7-bf53-42aa1e695d13","resolution":{"observed_at":"2026-08-06T16:14:22.520713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T10:46:49.751745Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03746","last_updated":"2025-09-03T22:09:57Z","snapshot_observed_at":"2026-08-16T22:24:16.737776Z","submitted_at":"2025-09-03T22:09:57Z","title":"Efficient Item ID Generation for Large-Scale LLM-based Recommendation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:49.751745Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2509.03746"},"observation_digest":"sha256:df1ab8b0bca4b2f502a6a06c2b63238ca565c688159f9e2a7d90d3e97bdd6767","observation_id":"6cdc3b44-ecae-4a26-ae82-569ed53695b0","resolution":{"observed_at":"2026-08-05T10:46:49.751745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2510.08055","last_updated":"2026-04-16T12:39:23Z","snapshot_observed_at":"2026-08-07T14:10:12.842070Z","submitted_at":"2025-10-09T10:41:35Z","title":"From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T08:47:29.759674Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2510.08055"},"observation_digest":"sha256:0f3753591e757c7757b8549330cc33c26c334c2350b4784427ec7a604c79a34c","observation_id":"4b11f7e9-a006-4f41-9ac0-d6e1264d6ff8","resolution":{"observed_at":"2026-05-18T08:51:08.938424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2511.00413","last_updated":"2026-04-23T16:13:03Z","snapshot_observed_at":"2026-08-15T18:18:58.971403Z","submitted_at":"2025-11-01T05:56:49Z","title":"Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T02:04:46.559881Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2511.00413"},"observation_digest":"sha256:35f2ae21b786f2150556079a810505452b21758d6d1c501f86905eb03c077154","observation_id":"5b5bebc3-06fd-4ab5-a9f6-29afd0d72509","resolution":{"observed_at":"2026-05-18T02:05:39.116323Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-02T21:52:58.923503Z","title":"Rasmussen, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18955","last_updated":"2026-06-03T21:26:24Z","snapshot_observed_at":"2026-08-16T02:55:12.388981Z","submitted_at":"2026-02-21T20:30:04Z","title":"Incremental Transformer Neural Processes","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T21:52:58.923503Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2602.18955"},"observation_digest":"sha256:5795c1076553b69bd5e8c058d947db67778dc7328781b76a38ddd0ab6a944f7d","observation_id":"3c24d81d-572b-4fff-9a4b-c0f397a30751","resolution":{"observed_at":"2026-08-02T21:52:58.923503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-16T13:30:40.009888Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:46ac312fd57cc3f67931430663a82f5022a192bc546985aa4a07cd767de6aae9","observation_id":"7b535baf-9b7d-4ea7-9668-a50fe86a4abc","resolution":{"observed_at":"2026-05-21T06:39:04.533914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2604.02337","last_updated":"2026-01-24T05:42:19Z","snapshot_observed_at":"2026-08-07T08:50:40.934140Z","submitted_at":"2026-01-24T05:42:19Z","title":"Generating Counterfactual Patient Timelines from Real-World Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T11:42:42.030779Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.02337"},"observation_digest":"sha256:f39e00d7ac19d4a9e911c5f55c171888702239c33cdd0b980682a7cba77f414c","observation_id":"d9e1594d-7aba-4c8d-947e-142a96c067e7","resolution":{"observed_at":"2026-05-16T11:42:48.829434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2604.04750","last_updated":"2026-04-09T14:13:19Z","snapshot_observed_at":"2026-08-15T16:24:53.602682Z","submitted_at":"2026-04-06T15:16:35Z","title":"DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T19:04:17.725111Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.04750"},"observation_digest":"sha256:3adc02f62c71f26dd25a1864a7240a587d266b43e0cbfd46453f3c19f6192d52","observation_id":"ce15ca23-97f6-48f2-a545-5d59ed51e8ee","resolution":{"observed_at":"2026-05-10T23:30:52.018231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2604.09593","last_updated":"2026-03-04T15:59:46Z","snapshot_observed_at":"2026-08-08T17:32:49.905670Z","submitted_at":"2026-03-04T15:59:46Z","title":"Benchmarking Compound AI Applications for Hardware-Software Co-Design","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T16:17:08.045511Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.09593"},"observation_digest":"sha256:d886fd30ddcade24333493888a7d6e70d994c429798b66c69f86b883906805bb","observation_id":"7ade546f-7fe1-4dad-ab0c-e03dd36c01ec","resolution":{"observed_at":"2026-05-15T16:20:09.843335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2604.11659","last_updated":"2026-04-13T16:09:26Z","snapshot_observed_at":"2026-08-14T06:01:32.511023Z","submitted_at":"2026-04-13T16:09:26Z","title":"GPU Acceleration of Sparse Fully Homomorphic Encrypted DNNs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:14.625291Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.11659"},"observation_digest":"sha256:b3a5c94c7b8b151bd5e8563e54e216feb3ffbd9768dc68b95896df43add95e6c","observation_id":"74e644a0-27aa-498f-ba03-2f97857c51f8","resolution":{"observed_at":"2026-05-11T10:56:03.350227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2604.20021","last_updated":"2026-04-21T21:56:43Z","snapshot_observed_at":"2026-08-15T06:44:58.110677Z","submitted_at":"2026-04-21T21:56:43Z","title":"Continuous Semantic Caching for Low-Cost LLM Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:32:28.923367Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.20021"},"observation_digest":"sha256:2113d6b99596550f6fd304a6cba528b05d416ffba58482aa935c55cb003f262d","observation_id":"e83c417c-21c8-4736-835a-9a50fb8a06fa","resolution":{"observed_at":"2026-05-11T13:01:03.174067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2604.25975","last_updated":"2026-08-10T08:59:48Z","snapshot_observed_at":"2026-08-13T23:39:00.094820Z","submitted_at":"2026-04-28T12:28:04Z","title":"Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-07T16:41:23.234607Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.25975"},"observation_digest":"sha256:a51d697c10e3375775e2c23a9630259040141c8dd6fd632a4aaefa9ea164faf2","observation_id":"5e1e20ed-d45a-466c-92a1-cbd613639350","resolution":{"observed_at":"2026-05-11T23:36:23.906304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-07T10:42:27.644514Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:09dddd86fb5408f381f040abde951e1b1c4e80a368cb72fe80fcface3ad0fdff","observation_id":"8848a48d-05dc-45ea-85a1-fe771068d49b","resolution":{"observed_at":"2026-05-12T09:31:26.083007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-02T15:28:12.785926Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T15:28:12.785926Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:d20a8ff2d22cdd6072815d79515f859a2f9e0218e313cd4b7eb5a45953132254","observation_id":"450f4a24-9764-49a5-b98e-82aebb3fc6f7","resolution":{"observed_at":"2026-08-02T15:28:12.785926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2605.30580","last_updated":"2026-08-04T17:55:16Z","snapshot_observed_at":"2026-08-07T23:11:37.090408Z","submitted_at":"2026-05-28T21:15:24Z","title":"Speculative Decoding and the Curse of Multilinguality","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-29T07:15:35.673216Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2605.30580"},"observation_digest":"sha256:b77d7d8f0fc8cad1bf0917208d7bfec170b37054a985cee127535f33a44ee462","observation_id":"9e29908e-4592-4e72-a2f8-39160a6478fd","resolution":{"observed_at":"2026-06-29T07:23:13.183398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2606.23406","last_updated":"2026-06-22T14:30:47Z","snapshot_observed_at":"2026-08-07T08:16:17.853171Z","submitted_at":"2026-06-22T14:30:47Z","title":"HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T08:46:01.500880Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2606.23406"},"observation_digest":"sha256:991bb46484dbde7524b7155095217bb991a12b975d58c1f857fb057008db95ba","observation_id":"6270690f-4f21-4548-85fb-8fd3762ffe9a","resolution":{"observed_at":"2026-07-04T10:29:45.495111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2606.23419","last_updated":"2026-06-22T14:42:34Z","snapshot_observed_at":"2026-08-12T12:58:28.591609Z","submitted_at":"2026-06-22T14:42:34Z","title":"GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:32.577228Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2606.23419"},"observation_digest":"sha256:dff1632e6f7eb97ed18953c573cea9b72150933fb1f1c50dbf0e5f1b9b7df3ba","observation_id":"4e7bce96-5d4b-473b-a00a-6879787917c9","resolution":{"observed_at":"2026-07-04T10:39:45.470405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2606.24033","last_updated":"2026-06-23T00:17:48Z","snapshot_observed_at":"2026-08-13T08:08:50.228783Z","submitted_at":"2026-06-23T00:17:48Z","title":"RoPE-Aware Bit Allocation for KV-Cache Quantization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T01:05:13.790381Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2606.24033"},"observation_digest":"sha256:94c96d9e101f8d22cbe957f5ae24f993c0531f1fbe5eb9194ab133ab945e48a1","observation_id":"c43ee846-db3c-47c7-abef-8aa481831865","resolution":{"observed_at":"2026-07-04T15:59:57.375836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2606.30877","last_updated":"2026-06-29T20:07:47Z","snapshot_observed_at":"2026-08-13T09:23:07.348548Z","submitted_at":"2026-06-29T20:07:47Z","title":"A Systematic Approach to Multi-Agent AI from Advanced Regulatory Control Theory: Safe and Auditable LLM Operator Agents for Process Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T01:38:42.824342Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2606.30877"},"observation_digest":"sha256:8368ac15a5fdbd9b9aec2619f6752d7ace8efeed767b84b15d4f45a0d34f2094","observation_id":"617743ab-1c39-43d5-8a12-9e5686752c8e","resolution":{"observed_at":"2026-07-01T12:55:44.184963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-07-12T02:29:52.764344Z","title":"Efficiently","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05439","last_updated":"2026-07-03T15:50:24Z","snapshot_observed_at":"2026-08-17T14:06:36.120954Z","submitted_at":"2026-07-03T15:50:24Z","title":"Design-CP: Context Parallelism for Design of Protein Nanoparticles","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-12T02:29:52.764344Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.05439"},"observation_digest":"sha256:4dce30f76adbf46b9b97b9cf77178d1a073ad39a8b49f1f6440dc1136e0bf896","observation_id":"65435f22-087c-4829-805e-b9e642318c20","resolution":{"observed_at":"2026-07-12T02:29:52.764344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-07-11T05:27:55.437107Z","title":"arXiv preprint arXiv:2211.05102 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05583","last_updated":"2026-07-09T02:10:45Z","snapshot_observed_at":"2026-08-18T04:13:33.656244Z","submitted_at":"2026-07-06T19:28:40Z","title":"ResonatorLM: Causal Resonant Field Mixing for Efficient Long-Context Language Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T05:27:55.437107Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.05583"},"observation_digest":"sha256:5429310499edc2cdd82e42f353836fa2b28fbf3ff955e7f3b1315571a2d19981","observation_id":"2e10be75-4514-4f73-910c-8c114af35cf2","resolution":{"observed_at":"2026-07-11T05:27:55.437107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-20T02:52:02.866492Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T22:38:12.637901Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:993a83a8e9608c00e159bb8935a76e25a91f63e1ddc05b2df920d96f33d4709d","observation_id":"c36018a4-bdc7-44a3-98d5-ba5ac65e3bac","resolution":{"observed_at":"2026-07-08T22:45:40.144012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-20T02:52:02.866492Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T01:55:09.658053Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:a9214af5bc32ff114fc6ca0e165b5f217083b0c461c93ed85ccf73ad70720adf","observation_id":"f169fdc9-3abf-4a0e-9e19-acaf3707c28b","resolution":{"observed_at":"2026-07-11T01:57:51.691294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-02T04:42:47.305650Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14172","last_updated":"2026-07-15T09:42:59Z","snapshot_observed_at":"2026-08-20T04:50:07.515208Z","submitted_at":"2026-07-15T09:42:59Z","title":"The Cost and Network Limits of Space-Based AI Compute","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T04:42:47.305650Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.14172"},"observation_digest":"sha256:f58e341e19baf9b950ca224514d6696de1924bef5b1f1c377b5b601b1e10ba51","observation_id":"0dcb5b3c-aeb2-460f-9584-371ba5f6596f","resolution":{"observed_at":"2026-08-02T04:42:47.305650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-01T12:03:18.853036Z","title":"Efficiently scaling trans- former inference.ArXiv, abs/2211.05102, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19704","last_updated":"2026-07-22T03:06:57Z","snapshot_observed_at":"2026-08-18T05:28:31.879685Z","submitted_at":"2026-07-22T03:06:57Z","title":"Efficient Clustering with Provable Guardrails for LLM Inference at Scale","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T12:03:18.853036Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.19704"},"observation_digest":"sha256:57c95a2609a15af91541cea06eabf6b9c9ee8a55c007ad847d3a991705c5eb94","observation_id":"91092c63-81f6-4338-b79e-094edccb645d","resolution":{"observed_at":"2026-08-01T12:03:18.853036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-07-31T19:52:42.278984Z","title":"Ying Sheng, Lianmin Zheng, Binhang Yuan, Zhuohan Li, Max Ryabinin, Beidi Chen, Percy Liang, Christopher Re, Ion Stoica, and Ce Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-19T08:04:26.359104Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.278984Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:552892fcae946229e0437d6b2b90290c8d55ad2b73550c6ed86491d0c795bd6e","observation_id":"9bcae3a8-d910-4835-b8d0-a087730dd323","resolution":{"observed_at":"2026-07-31T19:52:42.278984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-01T15:42:57.155893Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26444","last_updated":"2026-08-11T03:33:24Z","snapshot_observed_at":"2026-08-14T23:09:40.363250Z","submitted_at":"2026-07-29T03:45:05Z","title":"StrataCL: Fabric-Native Communication Library for Production Supernodes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:57.155893Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.26444"},"observation_digest":"sha256:c3e6c9aa1b8a20604575106209f0461e1bf755d182773ec7b01a063fac290548","observation_id":"52e0d750-d1b7-4592-ab19-68ddd67a108b","resolution":{"observed_at":"2026-08-01T15:42:57.155893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-03T10:57:57.766979Z","title":"Efficiently scaling transformer inference.arXiv preprint arXiv:2211.05102, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-19T02:00:50.332216Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.766979Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:3ca52fc3b2ddfb0df654c774801e8bc7c2a7d6c38373cab2301ba491241b4cec","observation_id":"60fae710-b15f-47ad-aaab-3b0a667bc766","resolution":{"observed_at":"2026-08-03T10:57:57.766979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-14T04:35:59.803368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-18T05:00:28.829626Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.803368Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:906f6f286f4612231561e9559d7cbd19e227cdac9bd192393481ccaa80b96c9f","observation_id":"38d93a2f-d049-4842-a7ab-0c1bcbdb32c5","resolution":{"observed_at":"2026-08-14T04:35:59.803368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2211.05102/citation-record","integrity":"/paper/2211.05102/integrity","json":"/paper/2211.05102/citation-record.json","paper":"/paper/2211.05102"},"outbound":[],"paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2211.05102."}