Pith. sign in

Paper Citation Record · LEDGER

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference

As of 11 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2501.11779.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.11779 v2

Coverage vector

measured 65 of 65 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T18:01:46.443737Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-29T10:07:06.141581Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-29T10:13:17.805330Z

Reference resolution

65 of 65 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved62
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd8de5fb-360c-4b60-9eb0-a7750f47ec22 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.812432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.140974Z digest=sha256:cca9fc78b10d42f7dfee29122ab5a709e07ae6c59a4385b4418cad8979bce54e

Observation 9afcc265-6c9e-493f-b264-bc249066982e · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.797233Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.146738Z digest=sha256:e6a9ed57c4edb481f9d15c3963d28755f2c4e6f00872a1aac71575c5d276ec33

Observation b17145cb-ea74-4204-b576-b5c5fa1b91f1 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.782633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.152117Z digest=sha256:967bca503a83912cdf34c67c404616252f064e7a2fce34c2cb1a88285f63597d

Observation 40834a54-9776-447b-9d81-0578cc68fa6c · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.764911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.156915Z digest=sha256:c15c1b6a3b39d56cd355f02f7c71cd87c19308d9947f2b3eb317c8290e496283

Observation 5476b1d9-7ca1-40a4-a9fc-ce9d313715b6 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.749908Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.161851Z digest=sha256:c3f422cb4ca9978ffb456dac5b9579d8b273aef901a631c21fa71afb71f7de67

Observation 32ae0556-c6f6-4648-9fc9-bef2c07adc3f · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.732416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.166848Z digest=sha256:67e0aa14af6bc754efdb5d6d532fb59b2227fdce4a007f3d583cf58096b8461c

Observation 185deb44-aa19-4381-b0c9-6c2c9ad6812b · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.715213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.172598Z digest=sha256:653e1625e99bda8715483227f1e312730f53a9a2eecf9cda5b6e245dd41b8c46

Observation d6f5c94e-829c-40e4-b784-ebd37a967a15 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.698905Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.177212Z digest=sha256:e224e7e7a6de913d860c9b203c9a4aee211e9117bfc1cd8ffa7cdf313391735d

Observation 5a96ce76-ce01-404f-91b7-de152b17b688 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.680983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.181969Z digest=sha256:c00ea84adecb03e4fea3a884af3946301090c58e35b67689164e33dbcf59a4fd

Observation 49fd9485-fe74-4915-ab5c-509fc4535d98 · outbound

This paper cites IEEE Standard for Floating-Point Arithmetic.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference IEEE Standard for Floating-Point Arithmetic

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.186890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.186890Z digest=sha256:da27be008186276a48695f3170f90801473197be24a907a52f8f00b87704b4ee

Observation 30508ef3-964c-4a89-b862-55a835c64b15 · outbound

This paper cites SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.191693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.191693Z digest=sha256:c0cd8e91b78556510b21c5439fa17955d8dd8d32e223cc2db55f3c0e51662cf8

Observation 0b852a1a-d85d-48e5-ac61-781431ef0e37 · outbound

This paper cites GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.196980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.196980Z digest=sha256:a15d8e38f730026227a2a1b9c17b92ec955ee82e627dde9d136f56b5a607c306

Observation d873e317-48e0-4e95-9548-57e999c07e5a · outbound

This paper cites DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.202032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.202032Z digest=sha256:8c1346c2f8d35ce24c9c03cae62844edfe947e7a54c5023f4bd95494cbcf5054

Observation 4b10e56c-ab3a-48e8-8081-68882a03d8eb · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.664194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.206986Z digest=sha256:882ab6ab84817751919abaf3445cffcdfbb0c2cb84e3c23d4c9f6fa1092cc017

Observation 821c8ffe-0d58-480e-ad1a-3e3f0e051c72 · outbound

This paper cites Language Models are Few-Shot Learners.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Language Models are Few-Shot Learners

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.216356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.216356Z digest=sha256:d2dfb4a97883ba2b22325109c77ba3dee8307d8e42f8c79d277aa63d3afd9514

Observation 6b0f0fc0-f990-4b19-974a-1ff4ed8a7f96 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.221091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.221091Z digest=sha256:b583ff6045ff1672422764831031bdd86baf34ba9c7589b0ba7d46ade109d904

Observation dfc4d592-14b0-4872-b016-572b6b7205cb · outbound

This paper cites Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.225490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.225490Z digest=sha256:3ee312a52d08235c9a7f8d730527cc53af361949b7ea30c8c58614ea40428417

Observation 98e3309a-8922-4408-8530-5963028a63ff · outbound

This paper cites Gonzalez, Ion Stoica, and Eric P.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Gonzalez, Ion Stoica, and Eric P

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:01:47.647618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.230083Z digest=sha256:76c5c2f499704c9a3c29474a833d0cf9e7e2027845cbfb4064a67842c63632c1

Observation f7acc176-41e2-4c67-900c-1bfb10329ef2 · outbound

This paper cites FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.234652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.234652Z digest=sha256:257f47986280dfae5978ab6d023c52c3ec9d34ce1c57d9fef66d741a82af4c72

Observation a0020f9a-f8d6-4595-8b60-7ddc5010b49c · outbound

This paper cites Fu, Stefano Ermon, Atri Rudra, and Christopher Ré.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Fu, Stefano Ermon, Atri Rudra, and Christopher Ré

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.239316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.239316Z digest=sha256:a9a74fc46597cebd73474d39bc6b33fee73009f4c2929fb724d24f9f85bb2cd2

Observation fa93b2c9-582e-40a1-a862-d63a7b72ce3c · outbound

This paper cites The Llama 3 Herd of Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference The Llama 3 Herd of Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.247690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.247690Z digest=sha256:2784ba896b8c34e667887f218e71d926ef7ee1747b25d50d9aa7efd02213c9d4

Observation 6de14574-7611-41a9-bc56-159929147cf3 · outbound

This paper cites FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.243579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.243579Z digest=sha256:cd471407274745d041695149dbcaaaeae86787c959f3e581b4531b72f3a8d84b

Observation df405801-7510-4393-ba9d-c170c58d0343 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.621766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.256388Z digest=sha256:90ea52f75d57509757e8ac9672b901bcc7d9e95a3a8797b9822e2eef4cb78c8d

Observation 230a61d0-3247-457e-8bf9-041081624c0e · outbound

This paper cites A Review of Sparse Expert Models in Deep Learning.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference A Review of Sparse Expert Models in Deep Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.251978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.251978Z digest=sha256:88889d28e96a983fb76511bf03feaa08c2e16b94ed533d6165ce1c04b8d1cada

Observation e5db946e-4b6a-4c3e-a57b-2ba309b685e3 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.606695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.264975Z digest=sha256:7b10c5ab0127084a60ca4bca3810da4a18e75ad3c2340a95c7acee832fc63f06

Observation b71d3ac2-652b-4b38-bf8e-b82d796d912d · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.260751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.260751Z digest=sha256:813bf4e44d3cd411cbf26fb34bde5a6d7b9105741a666dc6fd72347ad6727f0d

Observation 7be11884-41b4-47eb-aaa8-98915c69c71e · outbound

This paper cites Hydragen: High-Throughput LLM Inference with Shared Prefixes.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Hydragen: High-Throughput LLM Inference with Shared Prefixes

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.274340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.274340Z digest=sha256:410df7e746581b2c0a3e5be382e3b8c51393759b39a29f0c9d3b0a1deb681619

Observation d4b7bc4e-ddf8-4658-af62-ab28c98b8f48 · outbound

This paper cites Mixtral of Experts.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Mixtral of Experts

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.269431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.269431Z digest=sha256:6c941739a1eafe41d7d44726f3ea2ed17c345b358dba5e964b05418010ce0c48

Observation f8976462-c76a-4b5f-abbb-98e1e5806d2d · outbound

This paper cites AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.288769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.288769Z digest=sha256:570400d20d38357dadb0e8b097ef578e7be548628e54f29365b1b0c0d5923933

Observation bd323758-0973-4522-b625-69ca3526214e · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Gonzalez, Hao Zhang, and Ion Stoica

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.279142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.279142Z digest=sha256:0456f1cc4e83b180d78135ea9126b2bb4c0d28cf745a0c5a4bdd43670863500c

Observation 0114ff0f-e917-4c51-826f-57473f90e5c3 · outbound

This paper cites AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.298972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.298972Z digest=sha256:8562d8632aa0f9a3903954a658dd723b7cc90617ae9c15257092ff4200756f2d

Observation 8e6f5535-8ba1-432d-8af5-80c971140973 · outbound

This paper cites Ring Attention with Blockwise Transformers for Near-Infinite Context.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Ring Attention with Blockwise Transformers for Near-Infinite Context

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.304481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.304481Z digest=sha256:7fbdba91fb4e4a4ceab0b222d09dd2719cc0df0a97fbf1ffee0049b1f080c283

Observation fa98683e-5b9a-43f0-a904-6183b0d6c34c · outbound

This paper cites Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.293818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.293818Z digest=sha256:8d4b0b0ac7a62e2ae13e3e916405ff26a2eac8e7e021d20b6916e3bcb3e4c84d

Observation ee5166c2-c1a0-4b1c-adc1-74aa3e589515 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.313249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.313249Z digest=sha256:d50015314b48821b294bc7f9f9c5ddec4b43e74eb87d5a0a3f8f51e3849c23a8

Observation 9b20b16e-4b1b-4b6b-84d2-eeba8a108ed3 · outbound

This paper cites Can Foundation Models Wrangle Your Data?.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Can Foundation Models Wrangle Your Data?

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.317445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.317445Z digest=sha256:62d3e23fe8fcb0ec529f24faf569f3ec66ac23c57f4954ba3489998130c38994

Observation 6328fcdd-c8a6-4999-ae95-e56846b34da7 · outbound

This paper cites Very Deep Transformers for Neural Machine Translation.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Very Deep Transformers for Neural Machine Translation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.309018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.309018Z digest=sha256:55b89e0fa5bd35612bd5b612e2bfed1e5e1e974751c4dbc6a27b253078b89e46

Observation 6fe44fe3-76cd-49eb-aa0b-1d355d017a14 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.325426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.325426Z digest=sha256:7a3d13b6c4c7c07094871be0de2669fc2702ccdc2f80cdb1fd0492491109eabe

Observation c77e6827-4ea1-4d3f-a9bc-6b04e3dcacaf · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.566549Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.329244Z digest=sha256:0ee660397021e37bb3de82370e02a5050617ee8bb9c77a62af461baf49019667

Observation a12cfd8b-e8f4-4433-b6db-008b8cc6c386 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.581844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.321446Z digest=sha256:6779bcfd875280fcce7917934717d997b8aa763bec6cec8d1ece55afeaf09b9e

Observation d608c8dd-c737-4c05-acef-536a9115555d · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.551053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.338347Z digest=sha256:2f424b76dd68e004e036482e9d0192e533b1bf65eb321118a0ee158e949f39a0

Observation ed95a91c-db04-4f62-89b6-c23584fb5e00 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.342837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.342837Z digest=sha256:cbd334c18b921526529d6124f639498fab1f623fc546a14d5e6336ed699aa52d

Observation 008b4344-7dd3-45f0-807d-d483848decd0 · outbound

This paper cites Splitwise: Efficient generative LLM inference using phase splitting.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Splitwise: Efficient generative LLM inference using phase splitting

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.333688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.333688Z digest=sha256:76ea960eb5ffc58ebe2a0d4de7881ff3c9acba14dcea55fe0aac87d0de23e33c

Observation 09dea148-68ba-4b46-ab31-f4962826ad67 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.352066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.352066Z digest=sha256:ef41e0eedd08716fa7a3f4fab205c20adfea95daf6d65762e545f758dfb46cb8

Observation 4a4d17f1-51ec-4698-af02-cf6ce691bef2 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.511723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.362128Z digest=sha256:6e7f6bc8f150866011b55fbc3bd1b1be0125238d1c2ea2d057c9ef717bf36740

Observation 8a63bae5-8be2-49fb-8f40-8dc294552bbb · outbound

This paper cites ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference ZeRO: Memory Optimizations Toward Training Trillion Parameter Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.347288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.347288Z digest=sha256:7cbad80da0003228ab3d91a8883ad24a77a6264eb2188be51d44cd4ac07b38d4

Observation e3109990-33ca-4a29-8056-87fc6b526f6d · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.371711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.371711Z digest=sha256:5646e61e8aa45e1fe320674624ea9a6aa3e28e67d509a388ca02336ca2831d7d

Observation 538f9376-388b-4a88-bd12-368ad2660701 · outbound

This paper cites FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.376642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.376642Z digest=sha256:ce913493717cf56f83c42f78890597394470d24f45e9e977c31720021350c20b

Observation ddef0a13-13fc-4950-85de-3fddc4607b09 · outbound

This paper cites Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.381691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.381691Z digest=sha256:2154a7198d87666bde15785597705141765184fa0a49831cd92f3e7792905cf7

Observation afc9cdde-5e85-4042-8003-9455e23d8fd1 · outbound

This paper cites Fast Transformer Decoding: One Write-Head is All You Need.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Fast Transformer Decoding: One Write-Head is All You Need

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.366806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.366806Z digest=sha256:0237860f751fcd91c2ad639d284f223c26511f0ef579741132e70ab6b3e644c9

Observation 1388f066-5ab7-4032-800b-0946cd7feb8e · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Gemma: Open Models Based on Gemini Research and Technology

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.395770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.395770Z digest=sha256:9bf1ec262b7ebb42b2374df5ea19fa9dd6f7a620a0551d523858e8b7f51863f1

Observation e6e96f27-0529-4ed8-9291-2434bfab177a · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference LLaMA: Open and Efficient Foundation Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.400525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.400525Z digest=sha256:b037dd1832c94f0ea5d3430455d2b42b572da4d2ba82e6976035f5ec05614fc7

Observation c8075934-419a-4ff1-824a-69fc162d6966 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.405679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.405679Z digest=sha256:1bb3a2632772d9b6870afd2864caf79ee39164886a7569135075e54ff4e4a709

Observation 7b1b74c8-5585-4af5-9e9d-9f80e3477958 · outbound

This paper cites Hashimoto.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Hashimoto

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:01:47.495870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.386417Z digest=sha256:6025049df5f276940f7ed41eb9fb1115a2c9be855d543b558dd3228c0dc2ad07

Observation aa9fc5da-241b-48a4-a391-f12f25d25746 · outbound

This paper cites https://github.com/tatsu-lab/stanford_alpaca.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference https://github.com/tatsu-lab/stanford_alpaca

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:01:47.480502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.391253Z digest=sha256:95067808c53aea3394f500e6237e3f48be6b8c2fe182a6a4fd5095886f7c00eb

Observation 6638c6f8-f207-4fbc-9d19-e9a5194ea8a8 · outbound

This paper cites Efficient Streaming Language Models with Attention Sinks.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Efficient Streaming Language Models with Attention Sinks

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.419673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.419673Z digest=sha256:f262b0068401430593e063d7412ab9e0cd36628204722bb2f80497d11cace0ce

Observation 1a341c62-7758-4ef6-9b7b-f3a906243954 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.446422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.424728Z digest=sha256:f9196b578c24f3c29635c8c562a3e803b61f2c444cdf5844d00ec9138d06ce3f

Observation ead83c85-b29d-4a54-8b74-e380f9d34488 · outbound

This paper cites PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.429279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.429279Z digest=sha256:9f9dbc3b59545291fa4248bc2c2ebb0bd8bfdfa2e754d8366e9797f87fb3210a

Observation 94e4e9b8-bffb-405d-a62d-5efe4dd4944f · outbound

This paper cites Attention Is All You Need.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Attention Is All You Need

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.410490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.410490Z digest=sha256:c3d960c9dd06b4e115709f67e3a9f7ed287588152e1731cc77ddeb7f7860cff8

Observation 6aac2e18-c272-4954-a29b-1199c8c3ddca · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.463238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T18:01:46.414954Z digest=sha256:9b0321a9fe5492314094140fa95ea8a76f1cd9216e3fd0837539abf390d29829

Observation e6ae9f20-fcf8-4cfd-9b14-1d03b3498b32 · outbound

This paper cites SGLang: Efficient Execution of Structured Language Model Programs.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference SGLang: Efficient Execution of Structured Language Model Programs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.443737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.443737Z digest=sha256:70d04b8a5775907427d11f80041d71e38cd173abd18da8c3c38bb73fbb947c92

Observation 78efc752-fb3c-448b-8aa0-b3c6f03409f4 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.434131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.434131Z digest=sha256:d674964b3825e889300f04f1fd189438ba7ac8dc208fc6e3f3eaaf940f90491e

Observation 246c3827-a89b-4aa2-9451-d0bfe498b018 · outbound

This paper cites Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.438859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.438859Z digest=sha256:ed94fc57b60c8567779097ed5a9b58c08e41a382787650284eba4a6013b4f245

Observation f8781437-3a20-4210-8d3c-598c1a342079 · outbound

This paper cites ZeRO-Offload: Democratizing Billion-Scale Model Training.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference ZeRO-Offload: Democratizing Billion-Scale Model Training

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.357295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.357295Z digest=sha256:88c22d31cedbdd144a7d923255a9b523f44f9fba7b1358f5258594b4bdef9189

Observation 641f29ab-e41c-47fd-9499-c9961485dcc7 · outbound

This paper cites Petals: Collaborative Inference and Fine-tuning of Large Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Petals: Collaborative Inference and Fine-tuning of Large Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.211564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.211564Z digest=sha256:17e6e8d69da257d8bab5bc671845641a9ead7f67e0293f4d72d22f41b7b53446

Observation a5ea8d80-6826-4545-b75a-8d3a2f494986 · outbound

This paper cites Efficient Memory Management for Large Language Model Serving with PagedAttention.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Efficient Memory Management for Large Language Model Serving with PagedAttention

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.284071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.284071Z digest=sha256:2f11b1c14b4765aa75940b8ac5b33fe802c28a65fc5278ad82f07be8a99424e6

Pith citing papers

Observation 92ab72be-fe40-44fe-beda-082c7f07b3c8 · inbound

SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference cites this paper.

SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference Glinthawk: A Two-Tiered Architecture for Offline LLM Inference

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-29T10:13:17.806801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-29T10:07:06.141581Z digest=sha256:73c0375f23e78b66b80dab165662b5ce6c8201bc11262ba44c4077da26db4f93