{"as_of":"2026-08-10T09:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19ec1416a9597088e2e569a18c392f52c50191696a6cda8daf1e68f3d69583d7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:18:07.705592Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T22:59:03.322421Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:fab18b76c908b25e13eaa998b502769bb76be2ccc9e97a2f4b99518bbc0d93c3","observation_id":"39900118-976a-4971-8a9c-d9c4cbe878d9","resolution":{"observed_at":"2026-05-17T18:00:50.431176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:acd02d7d944c9e52e1c367482c11fbe90ef4966b49855fefa87c42352d5b9d99","observation_id":"08dccdd5-98d0-49e9-8fc2-68424e18710b","resolution":{"observed_at":"2026-05-12T15:03:07.819111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-09T05:18:07.705592Z","title":"Deep- speed inference: Enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05220","last_updated":"2025-02-05T15:46:27Z","snapshot_observed_at":"2026-08-09T05:12:48.658321Z","submitted_at":"2025-02-05T15:46:27Z","title":"Aero-LLM: A Distributed Framework for Secure UAV Communication and Intelligent Decision-Making","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T05:18:07.705592Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2502.05220"},"observation_digest":"sha256:30939770e8a7b59ca210209522ec006d7cc4b745a56fe6870f7e4d842d19a04a","observation_id":"dd5d2662-76b1-44e0-91a3-18f9d06fb1ef","resolution":{"observed_at":"2026-08-09T05:18:07.705592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-07T15:39:16.021201Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14419","last_updated":"2025-05-20T14:31:15Z","snapshot_observed_at":"2026-08-09T05:18:32.061106Z","submitted_at":"2025-05-20T14:31:15Z","title":"SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:39:16.021201Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2505.14419"},"observation_digest":"sha256:de2e282b20750a4926f056e3fb0f91e71a47a99295f73d3e0c23714affa8155b","observation_id":"58157a7a-196f-4952-a0fe-cc8c9c97bf12","resolution":{"observed_at":"2026-08-07T15:39:16.021201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-07T13:32:29.198408Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.198408Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:d10a7710546117f77e0f530a6aa3ff8d88ebb8b95355a5504b3153a0a42ecf5d","observation_id":"c8abc7c3-bda3-4139-8f81-e0cb39023140","resolution":{"observed_at":"2026-08-07T13:32:29.198408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-07T13:12:55.546676Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22501","last_updated":"2025-05-28T15:50:48Z","snapshot_observed_at":"2026-08-07T13:03:18.495419Z","submitted_at":"2025-05-28T15:50:48Z","title":"EvolveSearch: An Iterative Self-Evolving Search Agent","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.546676Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2505.22501"},"observation_digest":"sha256:45b1fcf9b1968f34d5d0e57ea1d18694d9565c2861f39f6e1b9f026efbe03e47","observation_id":"2f5b486c-3f15-42ee-8066-5e3bcf0cabab","resolution":{"observed_at":"2026-08-07T13:12:55.546676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2509.09505","last_updated":"2026-04-12T10:29:26Z","snapshot_observed_at":"2026-07-06T22:28:48.082201Z","submitted_at":"2025-09-11T14:49:50Z","title":"Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T17:47:58.019030Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2509.09505"},"observation_digest":"sha256:cf1b408d9cb75d0bc96ff7c0069e3f6b2b59b9daa4b4f82da4939cbd9f9840ad","observation_id":"1bc7a03b-05fc-4f7c-abe1-632d5628a92a","resolution":{"observed_at":"2026-05-18T17:51:42.268813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2602.05695","last_updated":"2026-02-23T09:49:19Z","snapshot_observed_at":"2026-08-07T18:14:32.956858Z","submitted_at":"2026-02-05T14:21:00Z","title":"SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:56.380048Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2602.05695"},"observation_digest":"sha256:a507cafe52e356c214b682719b57cbd56bfb3d6fd0f1c24bfef1cd907cb1a0dd","observation_id":"de56e279-cca7-41aa-b6f5-8e0a892fad08","resolution":{"observed_at":"2026-05-16T07:07:29.589719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:448c2cf7cd705dceecb57a66f66abc644ac7e140f05a3bd5dbd0045b34c0d83e","observation_id":"48682b07-9fa5-4f44-9259-f8e962a6d74b","resolution":{"observed_at":"2026-05-11T11:31:01.439048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.04215","last_updated":"2026-07-31T15:51:37Z","snapshot_observed_at":"2026-08-05T23:14:25.096835Z","submitted_at":"2026-05-05T18:55:24Z","title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:18:05.789417Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.04215"},"observation_digest":"sha256:b858b9d88ea390b04848f418e512eead2f4c802265f97d9e92233cdc36f8215b","observation_id":"97c1c357-ece0-4476-ad31-83fd25f2782d","resolution":{"observed_at":"2026-05-11T17:41:08.897769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.04215","last_updated":"2026-07-31T15:51:37Z","snapshot_observed_at":"2026-08-05T23:14:25.096835Z","submitted_at":"2026-05-05T18:55:24Z","title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T06:49:16.271699Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.04215"},"observation_digest":"sha256:7398aca908a2f627b9947018fd01b7b9e2ebe295ca865adb35f7e05796a942c2","observation_id":"4b7cea5c-8342-4858-b4d1-0379d2ba33f4","resolution":{"observed_at":"2026-05-15T06:49:48.919062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-03T02:23:43.898162Z","title":"Deepspeed inference: Enabling efficient in- ference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.04215","last_updated":"2026-07-31T15:51:37Z","snapshot_observed_at":"2026-08-05T23:14:25.096835Z","submitted_at":"2026-05-05T18:55:24Z","title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:23:43.898162Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.04215"},"observation_digest":"sha256:a78f02b231a938744694a74e3efa4724246c5611d3c45057e0e7dc83b8b614cd","observation_id":"e122ca3f-c6ac-4e43-8450-0c2acab501e7","resolution":{"observed_at":"2026-08-03T02:23:43.898162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.11111","last_updated":"2026-05-11T18:20:10Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:20:10Z","title":"ShardTensor: Domain Parallelism for Scientific Machine Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T03:03:32.316700Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.11111"},"observation_digest":"sha256:6aea02a333a26530a20d350141744e298a4b4ec92b80fef1d3a70ada77e6397d","observation_id":"bafbf0de-24ce-459a-8c15-d717f12901b7","resolution":{"observed_at":"2026-05-13T03:07:09.104038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.18750","last_updated":"2026-05-18T17:59:18Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:59:18Z","title":"A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:35:32.225708Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.18750"},"observation_digest":"sha256:457f22bdcaf7e16a222ca27387a74e7c6386470efb4e7366818c8c76eb255c57","observation_id":"a83bf6aa-9455-413c-b910-edc84e1334a9","resolution":{"observed_at":"2026-05-20T07:38:09.365091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.27763","last_updated":"2026-05-26T23:22:55Z","snapshot_observed_at":"2026-07-31T18:23:26.053584Z","submitted_at":"2026-05-26T23:22:55Z","title":"A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T18:03:19.798168Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.27763"},"observation_digest":"sha256:0cd247e351090e28d9acf778c8ee141386de5025fe6f97a737f1ee2a4244f1ee","observation_id":"0bf0fca9-42f7-4096-af22-a01062156484","resolution":{"observed_at":"2026-06-29T18:03:47.843565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2606.17566","last_updated":"2026-06-16T06:12:05Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T06:12:05Z","title":"AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T23:07:13.368633Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2606.17566"},"observation_digest":"sha256:77828e690979d70a2e9bda922bb9f4ec995e04347ae5456d7fcff2813127165c","observation_id":"2ca665c7-8363-4c6b-8dd6-93f5aa9b6272","resolution":{"observed_at":"2026-07-03T22:59:03.324627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2606.27797","last_updated":"2026-06-26T07:30:41Z","snapshot_observed_at":"2026-08-03T22:47:57.900369Z","submitted_at":"2026-06-26T07:30:41Z","title":"Optimizing Teacher-Student Partitioning for Scalable Knowledge Distillation on HPC Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T03:06:29.733729Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2606.27797"},"observation_digest":"sha256:85a9d2b9cbd6a08957dd1e0d07b4133fd229813a9b404cab6739c07950d55a97","observation_id":"009c2579-6677-4a94-b3b7-aa8f7fa29de0","resolution":{"observed_at":"2026-07-01T17:45:52.278510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2607.01065","last_updated":"2026-07-01T15:25:21Z","snapshot_observed_at":"2026-08-05T09:51:09.302562Z","submitted_at":"2026-07-01T15:25:21Z","title":"GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-02T15:55:40.177742Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2607.01065"},"observation_digest":"sha256:699d44f3fdf3cf46421392851457d9d771e4636e4fd992a3137b397ca64daa3c","observation_id":"46693fd0-7386-4723-be2c-47a2a130340c","resolution":{"observed_at":"2026-07-02T15:57:06.415052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2207.00032/citation-record","integrity":"/paper/2207.00032/integrity","json":"/paper/2207.00032/citation-record.json","paper":"/paper/2207.00032"},"outbound":[],"paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2207.00032."}