Pith. sign in

Paper Citation Record · LEDGER

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2607.08786.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.08786 v1

Coverage vector

measured 36 of 36 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-13T07:32:31.866525Z

measured 36 of 36 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

36 of 36 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved36
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d0cf5530-4100-403f-bd8c-2b131fc5cd17 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:bf167d62b854a0d8c256555744715c047d5a71a89bfbe8b5ec2b662d27f4eb5f

Observation 039d512b-42fc-4446-817b-9e2370ce73dc · outbound

This paper cites Generating Long Sequences with Sparse Transformers.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Generating Long Sequences with Sparse Transformers

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:ee261e0f008ca7bbd63db96f2d6b138c22ca985ed588f5821748676ad8ce22a4

Observation 5fd17147-2199-44de-8f7e-84a5925b2ad3 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:c6543eb36ed4dd5d4ddaefe7612500c1c36c730669a7b60d18d378afc1a466d8

Observation cd4f4e3c-6cc1-47cb-975e-34bd23595af7 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:31dc37a3f395d282833aaf93aa8652f68608a344448e1261f84bc17575a85a7e

Observation cb61c7cd-d7dd-430d-892e-b9c55b6130be · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:64f35a081c61241d61ac480117e1f83967b9426406acaceff7a54c8d19ebe2cb

Observation 47b9df60-e9fe-47bc-874e-fe0027c757b4 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:594f1753253b36de93895064f9467a87ac62d4915245d392da8a44895ce226cc

Observation ddd8af86-96da-48c2-b56d-eb3091028c81 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:5802767961cd5ce59169b44f07d1ac9bcec868137cd24f4e59a38d7e6e7edf71

Observation 105be52d-c7df-4a21-bf80-156c38594128 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:87d9cd09a97cf8f724f2c6f0a658d547bd3b5bd58caf03cc6bbbf645c287f047

Observation 03d2457e-03a1-43b7-a64b-8607a4754edf · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:e8d0dbe750622610a1ce18a6d5484364bd898ed00fc16b1ee4deb92a564d7321

Observation 429f24c8-b477-4ee0-9925-715fc41c819a · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:838c3d04ad3b4e392f5dd96a8b5f7fc3469bb5c3e6649ad71052cb996eb05b2c

Observation d7fa3c7e-523f-4d69-b8bd-73e9b7ce2917 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:8a203d672ed1b10e16b10ebad7e76b34e6ab3620184cbdc1cfdca455e348a2dd

Observation 633c8c4b-4aa6-4e06-b7f7-cdc386e3999d · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:df82d263a43e3e5817005b643d0fde67e6ebd0587b3d0ea462942b9895951b85

Observation 8da298ec-cafa-4b43-a64e-999b194a603b · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:912a96d96875769d4401d36410ba528b07030b02ef706beb1fe7c8f58bbcbbd9

Observation 88f6543f-573f-4729-ac8c-e9ecfcf5157b · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:424b8b3cedd4f4b924e4a304cebc11b9d5844ef6ca13d6720b4982fb6195f21b

Observation 73ab3e9f-866c-40ec-8401-97cc9dedcce7 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:e35ad434feabf0864c457de046375cd494a0af61bbbca4ee5e845bc24fa2fc68

Observation 6d0ddaef-192f-4af9-846f-78a5c166523c · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:7605a2d11fa8dc6813a19d79d625590f4576b857caf2c671241dafa73c4d6e61

Observation e68baf3f-8c0a-405c-baf1-c58c66589486 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:91fe66f7339c85162fb4ec0b69822d9e73efadbfd4c8111d19f307e09fd802f0

Observation 8bca3f89-e262-4dcb-96a1-d62d44d93393 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:811d87a5bbdb2dcbe629ecbe5206b54d5c4f99f0ff421d1ed516d619204db7ab

Observation 3d2ea893-bfed-4c7c-bdea-84039af51db9 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:3c6f44d8200ab136837ecedb0b2d0abebb9da7df6b64f0c47ffe11f74a457d56

Observation 7d453311-f192-4ef9-9781-13d8ec68cf52 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:a46a23e90ba72718f4cf2bfadada817d0b5a060613df188dd11c6574cfa14f38

Observation 0c09906e-8bab-425d-844e-db84854ae697 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:ffcb25e2f6142571ef7bdc9fb5e426d42d46ff7ba561a0a8366fded3615585ff

Observation 3b59cdd9-19b7-47f6-8081-9d22bad278bc · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:3fc12dc9a01355fda54df142de05715b73bc853399f2b8ef8d43cb1a124bdb37

Observation 1e151427-95a8-43be-89c9-a9d59594437f · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:6d07853f4d1776d13f0d0281400cc763af406514bcb3d3428119d17ba8511a1c

Observation 2f6ad3a4-c991-4d54-9e5d-9ccff413a265 · outbound

This paper cites Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:5d801a7102e94e68d5a36f1c2ec1b40d5b3784c96a55c5f843ef87f38a5541d8

Observation 3b8a06cf-6af1-4d1e-af6e-8862197fba1c · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:b741eb5a7fa8f3fc32ae9a5200e526a7eb354ac6e436a6ff618bbfd87e4642d1

Observation 9a489717-3b7b-432e-a2aa-846535eea616 · outbound

This paper cites 2003.Iterative methods for sparse linear systems.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices 2003.Iterative methods for sparse linear systems

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:cbf44b84632622e59a91e3a30a6d60f00663ffaa38377d1e38f591500af037ac

Observation a7abd195-2299-48a0-8b27-8be80e8719b5 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:060901ad5f0ced5a7b740959af43c67589f223d7da402db72f8c7edc45bc6ad8

Observation c83ceaa4-8714-4451-a2de-b9851f08b948 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:cb55f48b3bebf1a2032935bd455e9cd2dc8bc97e640272f4aaf24c2fe7bee47b

Observation f4943a2c-731b-4ffb-8164-9f435bdef137 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:36864ee241c6772a88192159c5ab886674cecff55b929a3ef02aaa10026a6474

Observation 0713b070-d974-4911-947a-046cb589503b · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:2fc8ad94544b559e0a3717a7a4e9b989780c04b8bf2099c8a4001b26f22545a7

Observation 8e0b6b09-347b-40c1-a311-5ddc4e06f5ca · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:7b3c859a2d594866e37066955b67eb9cdd0a1be637c128b33353fa47f4894fbd

Observation bb77f60e-7d70-4d34-b372-28e313bede74 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:b79b8c36f924b0aaa4fb4f618cb277fcfe79b7050f1554449e67c3e2a6f444ab

Observation dca45bac-1ef7-4c2c-9d69-2917dad3d82a · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:7ffc5525a1702f6e92aa3368caba8f3c0ba8aec9104a2cef2cd4e7f7bfea09e8

Observation aa2b316e-cab6-4296-b549-125f4995cbfa · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices OPT: Open Pre-trained Transformer Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:04475c816f46eb5dbd829980ed15411c5c3f1d5492162e332558003974159ae6

Observation 05c1cd9e-56e3-4be0-a3e7-2cc85682a38d · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:3c4178e2b711c6084561cc76bc712296a9f9e3860fcd12c982d55604fca91fdd

Observation c592ae79-9896-4d9c-aa21-6489a6679045 · outbound

This paper cites an unresolved cited work.

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices Unresolved cited work

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-13T07:32:31.866525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T07:32:31.866525Z digest=sha256:f080d32480b5b783eb0ebb281704dc557f6e881028806db7a9d6b366f41517ae

Pith citing papers

No inbound Pith citation observations are available.