Pith. sign in

Paper Citation Record · LEDGER

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference

As of 21 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2501.11779.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.11779 v2

Coverage vector

measured 65 of 65 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T18:01:46.443737Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-29T10:07:06.141581Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-29T10:13:17.805330Z

Reference resolution

65 of 65 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved62
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd8de5fb-360c-4b60-9eb0-a7750f47ec22 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.812432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.140974Z digest=sha256:d8823e216df3ce8ce28833793b75dcfc78fe1d953d9682f14c4067910efb0297

Observation 9afcc265-6c9e-493f-b264-bc249066982e · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.797233Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.146738Z digest=sha256:3d6e0cfbda8a2d8252c1be3d59e5bb2466628fee8f4219b11c4aa3474cd75892

Observation b17145cb-ea74-4204-b576-b5c5fa1b91f1 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.782633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.152117Z digest=sha256:af05ce04ebbffd31b1004762a746dff122b4398a660d733571826731e5bae907

Observation 40834a54-9776-447b-9d81-0578cc68fa6c · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.764911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.156915Z digest=sha256:10a218018b37a97b182062724158a24e48cfc61f05effb10d86764ac753efd61

Observation 5476b1d9-7ca1-40a4-a9fc-ce9d313715b6 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.749908Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.161851Z digest=sha256:48f1104fdf06bd2767d798b1b694554d2300490fb83e4559ff7fb3382447d750

Observation 32ae0556-c6f6-4648-9fc9-bef2c07adc3f · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.732416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.166848Z digest=sha256:75d8f15e53246dd9eb74d5869ff5f701df77a01caf8a53e690f19a4d33ee6147

Observation 185deb44-aa19-4381-b0c9-6c2c9ad6812b · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.715213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.172598Z digest=sha256:66af821691f97e3cc104b5acd6a7c5c91b7c9e503eebcd30ed078212ef7a5e25

Observation d6f5c94e-829c-40e4-b784-ebd37a967a15 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.698905Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.177212Z digest=sha256:8ac6d563544b0c2766c7fcc52a482b638ccd504d3ca00cf579df751752c21b41

Observation 5a96ce76-ce01-404f-91b7-de152b17b688 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.680983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.181969Z digest=sha256:555faf5e4480c73e86f4e8f3b99854a61eab6aa02b8c4f12e940cac03fc58a1c

Observation 49fd9485-fe74-4915-ab5c-509fc4535d98 · outbound

This paper cites IEEE Standard for Floating-Point Arithmetic.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference IEEE Standard for Floating-Point Arithmetic

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.186890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.186890Z digest=sha256:4ec667016b3f05b37cb9793d6ef4ef7989dc0855c84a736e21145124c10b4382

Observation 30508ef3-964c-4a89-b862-55a835c64b15 · outbound

This paper cites SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.191693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.191693Z digest=sha256:5de7d0dd2d75df38640249d956bd520ea8a8dd403767e0406a0ca79c29d4ce80

Observation 0b852a1a-d85d-48e5-ac61-781431ef0e37 · outbound

This paper cites GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.196980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.196980Z digest=sha256:339fca7dd879f2542d6a8c2e46d66db1f23aee8e9e79e36563bff2046eb0c5a1

Observation d873e317-48e0-4e95-9548-57e999c07e5a · outbound

This paper cites DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.202032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.202032Z digest=sha256:c99626a0357e7a66b8fb611daef06dcb2cc1d3a702fa15d4dc5fd3063a1a4bbc

Observation 4b10e56c-ab3a-48e8-8081-68882a03d8eb · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.664194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.206986Z digest=sha256:7150d62f61b746db0b0b39a30a151e5c5576591a268ea8c713d9203fa0181717

Observation 821c8ffe-0d58-480e-ad1a-3e3f0e051c72 · outbound

This paper cites Language Models are Few-Shot Learners.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Language Models are Few-Shot Learners

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.216356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.216356Z digest=sha256:8194acd8dcf968000040e22a21a852db434a6eb645c82ec6c0dfefb7ec5dca29

Observation 6b0f0fc0-f990-4b19-974a-1ff4ed8a7f96 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.221091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.221091Z digest=sha256:391b726004ff791517765322c476d24237d17790b4e98cf127d89fb119dbe500

Observation dfc4d592-14b0-4872-b016-572b6b7205cb · outbound

This paper cites Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.225490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.225490Z digest=sha256:5e08d7e2d498b3a6cce45dd7086d5a2d50d1dc61cad2cf0e14d00c6d93094c4b

Observation 98e3309a-8922-4408-8530-5963028a63ff · outbound

This paper cites Gonzalez, Ion Stoica, and Eric P.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Gonzalez, Ion Stoica, and Eric P

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:01:47.647618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.230083Z digest=sha256:525377b80274530f4627540bace00e26fc6722bd1f28399fd6c47095925f7d2e

Observation f7acc176-41e2-4c67-900c-1bfb10329ef2 · outbound

This paper cites FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.234652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.234652Z digest=sha256:492954eb7da8bc8355211fed5aba418e0c2091cd771fb3b93830018f1410e8a4

Observation a0020f9a-f8d6-4595-8b60-7ddc5010b49c · outbound

This paper cites Fu, Stefano Ermon, Atri Rudra, and Christopher Ré.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Fu, Stefano Ermon, Atri Rudra, and Christopher Ré

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.239316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.239316Z digest=sha256:6f89212a510f69c523d965c8982d7734e460a6e1efebd730efcf12aaf5a9fd6d

Observation fa93b2c9-582e-40a1-a862-d63a7b72ce3c · outbound

This paper cites The Llama 3 Herd of Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference The Llama 3 Herd of Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.247690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.247690Z digest=sha256:1cdc35617844f6b425c0233d0caed89410dfed7eb905acb8da4e78de8df0597c

Observation 6de14574-7611-41a9-bc56-159929147cf3 · outbound

This paper cites FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.243579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.243579Z digest=sha256:0da4a82b76fd25bdea8e4312e3010b5dbe30d3f3f6929b913a30307d599708bd

Observation df405801-7510-4393-ba9d-c170c58d0343 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.621766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.256388Z digest=sha256:cf3b32c710ae8efc072cc1df4acab5e6c97109ecc146a7121c6e22d2f745072e

Observation 230a61d0-3247-457e-8bf9-041081624c0e · outbound

This paper cites A Review of Sparse Expert Models in Deep Learning.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference A Review of Sparse Expert Models in Deep Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.251978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.251978Z digest=sha256:0f9c0748322c5ea483414164111d12cad837f24171b26beca309d0e79782e6d4

Observation e5db946e-4b6a-4c3e-a57b-2ba309b685e3 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.606695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.264975Z digest=sha256:84b4af32c00e81231b9e1964f27dd28a8161df355de09e7e52b73cdfba9524ce

Observation b71d3ac2-652b-4b38-bf8e-b82d796d912d · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.260751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.260751Z digest=sha256:17108d42d97506e3cbfa37cfdc996a1aa10a48ebf5d8f381a6f47ef038f1e004

Observation 7be11884-41b4-47eb-aaa8-98915c69c71e · outbound

This paper cites Hydragen: High-Throughput LLM Inference with Shared Prefixes.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Hydragen: High-Throughput LLM Inference with Shared Prefixes

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.274340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.274340Z digest=sha256:d922d5a6cd1c9a77d8eba6086a2b5d8f2e8e0d48eca9964cddb3ce9804c5c49b

Observation d4b7bc4e-ddf8-4658-af62-ab28c98b8f48 · outbound

This paper cites Mixtral of Experts.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Mixtral of Experts

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.269431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.269431Z digest=sha256:56c86f5dadb32694b63c6131d95b94aa6b8befba88f2c2daeb555e345778d504

Observation f8976462-c76a-4b5f-abbb-98e1e5806d2d · outbound

This paper cites AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.288769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.288769Z digest=sha256:df9a42992894b64465d05d2bec8638ec3bdbbfdcf14ec7b35263484a58273f2d

Observation bd323758-0973-4522-b625-69ca3526214e · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Gonzalez, Hao Zhang, and Ion Stoica

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.279142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.279142Z digest=sha256:80fc0372b0817b4d99c29e588400bbf5e3b52ce1ae627dcc2e40f462031f24bb

Observation 0114ff0f-e917-4c51-826f-57473f90e5c3 · outbound

This paper cites AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.298972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.298972Z digest=sha256:21654421debbb3c2f0152f4b19ee2cd8295b6ef5d2d43c579f3e6a0d876cc9ee

Observation 8e6f5535-8ba1-432d-8af5-80c971140973 · outbound

This paper cites Ring Attention with Blockwise Transformers for Near-Infinite Context.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Ring Attention with Blockwise Transformers for Near-Infinite Context

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.304481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.304481Z digest=sha256:4087e417c92be930ab36096bd856e513aba3bdc213855586483f4d526d9301fc

Observation fa98683e-5b9a-43f0-a904-6183b0d6c34c · outbound

This paper cites Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.293818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.293818Z digest=sha256:aeaeb139ce6c9db89fcbebccc29a146cdb88037985847e886df4df05957e8db6

Observation ee5166c2-c1a0-4b1c-adc1-74aa3e589515 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.313249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.313249Z digest=sha256:e677948b170b477209a1d2174f51e6a9481611252dcadf71cc0b1f01e6053771

Observation 9b20b16e-4b1b-4b6b-84d2-eeba8a108ed3 · outbound

This paper cites Can Foundation Models Wrangle Your Data?.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Can Foundation Models Wrangle Your Data?

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.317445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.317445Z digest=sha256:fb55e9de448d903e7bacbb04e0c80be1467e5053054268be764a13bb58679cf6

Observation 6328fcdd-c8a6-4999-ae95-e56846b34da7 · outbound

This paper cites Very Deep Transformers for Neural Machine Translation.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Very Deep Transformers for Neural Machine Translation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.309018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.309018Z digest=sha256:add66bbf91775fef72b23ceb46c4735d6eab79905237684419cdb93c4a88f0cd

Observation 6fe44fe3-76cd-49eb-aa0b-1d355d017a14 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.325426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.325426Z digest=sha256:314d9355109ca93c104ad56e678b369cbf25a227f9a3e50d4057445d341b52fa

Observation c77e6827-4ea1-4d3f-a9bc-6b04e3dcacaf · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.566549Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.329244Z digest=sha256:dbac0b328695ea44907df41a6e07c29c36eb4333e06048c6231a59cf9680950d

Observation a12cfd8b-e8f4-4433-b6db-008b8cc6c386 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.581844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.321446Z digest=sha256:41781c255bbb6def5d7916f62d51987a1ef8b4624e0cb9da2e5e9e571cd14add

Observation d608c8dd-c737-4c05-acef-536a9115555d · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.551053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.338347Z digest=sha256:f3cab6d28981b77e92199c0713b10ae5065722eea0fe20b35f7c49ecd5a415fa

Observation ed95a91c-db04-4f62-89b6-c23584fb5e00 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.342837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.342837Z digest=sha256:17d80a25126262c8a12778a797ef9447a051bf80f236a6959635beb85f265906

Observation 008b4344-7dd3-45f0-807d-d483848decd0 · outbound

This paper cites Splitwise: Efficient generative LLM inference using phase splitting.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Splitwise: Efficient generative LLM inference using phase splitting

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.333688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.333688Z digest=sha256:097471abb727649ff61925401e8a297e7ec0c00f7778c885836b3d52f227f3dd

Observation 09dea148-68ba-4b46-ab31-f4962826ad67 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.352066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.352066Z digest=sha256:adb9ab46065ad2dc4d9a5077996811a4cfa3e57a6f51da564ee037516a7d071f

Observation 4a4d17f1-51ec-4698-af02-cf6ce691bef2 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.511723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.362128Z digest=sha256:0fcb6f7528fd1c43accad33328d7e335aca50db141b038163bc6f8566a43907b

Observation 8a63bae5-8be2-49fb-8f40-8dc294552bbb · outbound

This paper cites ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference ZeRO: Memory Optimizations Toward Training Trillion Parameter Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.347288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.347288Z digest=sha256:a3e608e4eccf0cf6de4013d55ce1edd89f3670b321798188710436bab5e553e3

Observation e3109990-33ca-4a29-8056-87fc6b526f6d · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.371711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.371711Z digest=sha256:dbf513f1facf76bd63354604bdf93910d596e0e5b104b4d6045fab05be221e77

Observation 538f9376-388b-4a88-bd12-368ad2660701 · outbound

This paper cites FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.376642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.376642Z digest=sha256:3088b7085cc2ea636a05689ecc642d0310d4972446576f7331fc176e657ec806

Observation ddef0a13-13fc-4950-85de-3fddc4607b09 · outbound

This paper cites Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.381691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.381691Z digest=sha256:657c25d4a33cd3e10f825d0a415b4e9530d803e429fa6b5a83c981509b08dc24

Observation afc9cdde-5e85-4042-8003-9455e23d8fd1 · outbound

This paper cites Fast Transformer Decoding: One Write-Head is All You Need.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Fast Transformer Decoding: One Write-Head is All You Need

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.366806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.366806Z digest=sha256:6b1a4031aafe3af0fc2bfa3fb8edc36e63e9941e278b41835df0213770ed180d

Observation 1388f066-5ab7-4032-800b-0946cd7feb8e · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Gemma: Open Models Based on Gemini Research and Technology

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.395770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.395770Z digest=sha256:5ddc0738663070fd4254776d12157c04b0b2c165ab4ae40264b76fe534b3bc07

Observation e6e96f27-0529-4ed8-9291-2434bfab177a · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference LLaMA: Open and Efficient Foundation Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.400525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.400525Z digest=sha256:753191a3707978073f5dc21407121195412996faf61ff3c0a057853ce76a4916

Observation c8075934-419a-4ff1-824a-69fc162d6966 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.405679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.405679Z digest=sha256:2994069d43fdfc39964cc683bcbb8b28b45845b94df1583bf74c89fae5422f37

Observation 7b1b74c8-5585-4af5-9e9d-9f80e3477958 · outbound

This paper cites Hashimoto.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Hashimoto

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:01:47.495870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.386417Z digest=sha256:7593c833b911eb048c61e5233951fda0c78ddab2aa8107dad13ef13b6eac020c

Observation aa9fc5da-241b-48a4-a391-f12f25d25746 · outbound

This paper cites https://github.com/tatsu-lab/stanford_alpaca.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference https://github.com/tatsu-lab/stanford_alpaca

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:01:47.480502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.391253Z digest=sha256:9f6002bd869296f8868155992430131a61ae4a16a93bdec2d8acb8927f1c3c73

Observation 6638c6f8-f207-4fbc-9d19-e9a5194ea8a8 · outbound

This paper cites Efficient Streaming Language Models with Attention Sinks.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Efficient Streaming Language Models with Attention Sinks

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.419673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.419673Z digest=sha256:052938f9ee90611f238cf6865abdf80e078fb096113cda00e8368e10040ee00e

Observation 1a341c62-7758-4ef6-9b7b-f3a906243954 · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.446422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.424728Z digest=sha256:071d45f3a795a61f37a50d13ad8403cb50e02219ddf2b9bab87f4a4275d0e0c9

Observation ead83c85-b29d-4a54-8b74-e380f9d34488 · outbound

This paper cites PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.429279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.429279Z digest=sha256:497d3123bc37daebd08357e3e85444eee8630475c5c78459fed0142b8e0326d0

Observation 94e4e9b8-bffb-405d-a62d-5efe4dd4944f · outbound

This paper cites Attention Is All You Need.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Attention Is All You Need

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.410490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.410490Z digest=sha256:820b924e9922a83700ebe57535b20a53442546158e24c53280ce964331d9c4be

Observation 6aac2e18-c272-4954-a29b-1199c8c3ddca · outbound

This paper cites an unresolved cited work.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:01:47.463238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:01:46.414954Z digest=sha256:2e0c68d19fe44ed323197992ae1a8e4a0cfd10e81012bc96687fe2bdf0bb95df

Observation e6ae9f20-fcf8-4cfd-9b14-1d03b3498b32 · outbound

This paper cites SGLang: Efficient Execution of Structured Language Model Programs.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference SGLang: Efficient Execution of Structured Language Model Programs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.443737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.443737Z digest=sha256:4dcb40d3ca0b094ffd7f2ffb4e3d6f2a55396af0389eb5ce03440b0e064ea118

Observation 78efc752-fb3c-448b-8aa0-b3c6f03409f4 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.434131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.434131Z digest=sha256:4002b0331a53aea53379a82db15c4b3ce3ca679a92d76f9bc7b292d6e364fe8b

Observation 246c3827-a89b-4aa2-9451-d0bfe498b018 · outbound

This paper cites Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.438859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.438859Z digest=sha256:c79c4358394fc92bba1bbe3067422b3c17804797324dba2553226a8aea7b0a0a

Observation f8781437-3a20-4210-8d3c-598c1a342079 · outbound

This paper cites ZeRO-Offload: Democratizing Billion-Scale Model Training.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference ZeRO-Offload: Democratizing Billion-Scale Model Training

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.357295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.357295Z digest=sha256:d734da11282346a009f49b8588facab3311f8e46fd4d7edc00d50c9d3f54f3cf

Observation 641f29ab-e41c-47fd-9499-c9961485dcc7 · outbound

This paper cites Petals: Collaborative Inference and Fine-tuning of Large Models.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Petals: Collaborative Inference and Fine-tuning of Large Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.211564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.211564Z digest=sha256:2b264641119f70be8092c977164da03010c90fab491a82787184b9dbc04e04ae

Observation a5ea8d80-6826-4545-b75a-8d3a2f494986 · outbound

This paper cites Efficient Memory Management for Large Language Model Serving with PagedAttention.

Glinthawk: A Two-Tiered Architecture for Offline LLM Inference Efficient Memory Management for Large Language Model Serving with PagedAttention

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T18:01:46.284071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:01:46.284071Z digest=sha256:8c8676692061170cf7b37c1e18438a939c9fa29fc64e8cc1400b010afb0504ad

Pith citing papers

Observation 92ab72be-fe40-44fe-beda-082c7f07b3c8 · inbound

SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference cites this paper.

SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference Glinthawk: A Two-Tiered Architecture for Offline LLM Inference

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-29T10:13:17.806801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-29T10:07:06.141581Z digest=sha256:ab87ed7e74df2d956d8e2cf8ee915287f060a48343a490fd83a0bb4c41d905b0