Pith. sign in

Paper Citation Record · LEDGER

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference

As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2507.09010.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.09010 v1

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:14:34.248578Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

28 of 28 outbound references displayed

  • verified exact0
  • verified fuzzy15
  • unresolved12
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 125dcfd3-a8ce-415c-aff3-bf46e1c0c658 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:30.679512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:30.679512Z digest=sha256:fbad3765eaae3b01337edb4f03e65ab57426e9ea6333bab5013eb75299a46768

Observation 6a46ac35-ff27-42bf-88d0-41f738ec937c · outbound

This paper cites Architecting an energy-efficient dram system for gpus,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Architecting an energy-efficient dram system for gpus,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.886190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:30.781016Z digest=sha256:7827e9bface3238f60e242d6cc9d19d1dbd8e647a64bbaebb449fcc08bdb0021

Observation a25e08c6-6864-44fe-a9c9-88abd2013d9d · outbound

This paper cites Sparc: Token similarity-aware sparse attention transformer accelerator via row- wise clustering,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Sparc: Token similarity-aware sparse attention transformer accelerator via row- wise clustering,

Reference 3

Resolution
metadata mismatch
raw_fallback, observed 2026-08-06T18:14:34.814240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:30.882849Z digest=sha256:515d4cf3dd66e0034058129dfc8d2274731f834a9cd16397ace08d7565adae98

Observation 34755e6b-31d8-4b32-94d9-815620da707c · outbound

This paper cites Vs-quant: Per-vector scaled quantization for accurate low-precision neural network inference,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Vs-quant: Per-vector scaled quantization for accurate low-precision neural network inference,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.732439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:30.998677Z digest=sha256:d9f9f66229119f11255153e94cd3a14091521f72229801ded87e626615f3cfec

Observation 3a0cdbe1-cfcc-48f5-b0d1-54c28458854c · outbound

This paper cites Transformers are ssms: generalized models and efficient algorithms through structured state space duality,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Transformers are ssms: generalized models and efficient algorithms through structured state space duality,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.500968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:31.160451Z digest=sha256:c1e983a0aff18e1c6346de8ef153b5fb7d4f589cb420a4b66273ddd0a1540bef

Observation 66c0df4d-6f78-4f89-ba81-79b91d88541e · outbound

This paper cites The Llama 3 Herd of Models.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference The Llama 3 Herd of Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:31.335666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:31.335666Z digest=sha256:50d30f543dc1fba5643323a62611504e1fc9bc96f6a69537abf868ac6179b32b

Observation 3784dc49-c9c0-4a86-8470-cbfb4a3b2835 · outbound

This paper cites GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:31.524697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:31.524697Z digest=sha256:aa16a656d58d2f5c43cfd99ce307269e313f0c2817fc54e4fa0cb32abd31d836

Observation d8bc71ae-75fa-4932-9ac9-b44e22b27322 · outbound

This paper cites Ita: An energy-efficient attention and softmax accelerator for quantized transformers,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Ita: An energy-efficient attention and softmax accelerator for quantized transformers,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.287077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:31.678953Z digest=sha256:63a86d483c092e8e6aed1bac5f60fa7156762d8b8fc474962f82a380dd5eabe7

Observation 6ae7e611-7543-4731-9974-a386988a59ee · outbound

This paper cites A 95.6-tops/w deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference A 95.6-tops/w deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.034304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:31.808138Z digest=sha256:85c9eaf524f9fe32d6b082b0270fb66e963aa05febc9687c10620d03795cdeac

Observation fdb2cc5d-6404-4b53-92de-dc385ed4ba1b · outbound

This paper cites A modular digital vlsi flow for high-productivity soc design,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference A modular digital vlsi flow for high-productivity soc design,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.873081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:31.943718Z digest=sha256:6990a4edc7f9915e1a6aa19f8e2664a9f7d9b66132bcc1848a2f1e96ea9ee310

Observation b8d9e08d-f57f-4dab-931e-5d180b80849e · outbound

This paper cites an unresolved cited work.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-06T18:14:36.700328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:32.130864Z digest=sha256:b6bc47bfe5a1dd27e8fd79df506ded316d94fc814934ff648f1b5bae60f4032d

Observation 0387f486-e94f-49c8-8ebe-fc057f5bc4cd · outbound

This paper cites QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:32.263418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:32.263418Z digest=sha256:81d5b0d53a02643b76c4beba973a674f1f63fffa51c1f5949d5bb499644de603

Observation def74e63-7de3-44bf-a8cb-f29f4cb1ce2f · outbound

This paper cites Bucket getter: A bucket-based processing engine for low-bit block floating point (bfp) dnns,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Bucket getter: A bucket-based processing engine for low-bit block floating point (bfp) dnns,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.503663Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:32.395489Z digest=sha256:c525b6a76c7514d6c04fb6abbe22cb50b59ecd9b3e9dbe2e13154e0f05216b93

Observation 16c20b43-0be1-4b68-9fb2-77ac679ae042 · outbound

This paper cites Pointer sentinel mixture models,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Pointer sentinel mixture models,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:32.553413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:32.553413Z digest=sha256:441bc37c95ce08100b584e5d60d97984214d79a8f721dd9af67d6937e0ad76d3

Observation 81e4aa70-d83f-4540-996b-5287005ee479 · outbound

This paper cites A 127.8 tops/w arbitrarily quantized 1-to-8b scalable-precision accelerator for general-purpose deep learning with reduction of storage, logic and latency waste,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference A 127.8 tops/w arbitrarily quantized 1-to-8b scalable-precision accelerator for general-purpose deep learning with reduction of storage, logic and latency waste,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.352125Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:32.750560Z digest=sha256:8277bb192db0f58a92848699a60222f095faecef77bfecc737e02f6e353d1be4

Observation 68ca6f1a-0c32-4cd3-aa27-8741e8d6070b · outbound

This paper cites Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:32.895076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:32.895076Z digest=sha256:10de2011971aa06e6d9c32f97299ae0b5450449ccf6bcd3b60c77fbf113bde3a

Observation defed1f5-5f58-4e28-b12b-ed08d7d6e9d7 · outbound

This paper cites Nvidia jetson orin nano,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Nvidia jetson orin nano,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.207990Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:33.022172Z digest=sha256:10d25a4e7737e8491fb09d91623c9e965f620fa40a774fcc70ac63bbfc84c613

Observation 70b8b192-fcd8-4095-a1ae-e25967db41e1 · outbound

This paper cites Fine-grained dram: Energy-efficient dram for extreme bandwidth systems,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Fine-grained dram: Energy-efficient dram for extreme bandwidth systems,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.961479Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:33.116701Z digest=sha256:9f0c58a622ae6775a0ccc53ebcfd5a17e1ae3492a1623f0ee5afdc23c25c6345

Observation 20372408-fd1a-45c2-a80b-55319903ab74 · outbound

This paper cites Fact: Ffn-attention co-optimized transformer architecture with eager correlation prediction,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Fact: Ffn-attention co-optimized transformer architecture with eager correlation prediction,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.792388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:33.205827Z digest=sha256:0d7423fb022b23aca9c8c1a3cbfd43869ee651b39261da2fb9c669a5badf2c41

Observation 94c2d3bf-c2c2-4fa2-bfb2-d7bc4e72f9ce · outbound

This paper cites Mecla: Memory-compute-efficient llm accelerator with scaling sub-matrix partition,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Mecla: Memory-compute-efficient llm accelerator with scaling sub-matrix partition,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.605872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:33.352616Z digest=sha256:ffeed31da8529fbf72f124bcb0f5d017435ea9eaad32a8249773d12aa6debc00

Observation 260f865f-bf22-41ba-941c-9f2c8516265b · outbound

This paper cites Microscaling Data Formats for Deep Learning.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Microscaling Data Formats for Deep Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.447407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.447407Z digest=sha256:5f1d3777a7488e0e77dcde072eb5d2d7166a284d347fac7b31089abc915bf23a

Observation 9bc362b9-8a4e-4af1-ba6e-438221315542 · outbound

This paper cites Roformer: En- hanced transformer with rotary position embedding,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Roformer: En- hanced transformer with rotary position embedding,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.587252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.587252Z digest=sha256:a44419ffc59d0185b58760be833fe66b478d06e5490b01d4d87fdff1b0bf6b58

Observation 07c632fd-f886-4442-81de-7ebd830008e7 · outbound

This paper cites Retentive Network: A Successor to Transformer for Large Language Models.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Retentive Network: A Successor to Transformer for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.692647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.692647Z digest=sha256:48071cecf7d7b71062fd8e76f78bcd574bb5fa7c5bf5e56ae686ddd1f75f5112

Observation ffd7964c-373e-45db-95dc-293c43766d5f · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.762234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.762234Z digest=sha256:761fa54b0aa103f552d3baede473f30e5c675b24e9525b2ce54269e6b77154dc

Observation 44f1cfe7-9c9c-4ac1-b62e-a6cc49823000 · outbound

This paper cites Sole: Hardware-software co-design of softmax and layernorm for efficient transformer inference,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Sole: Hardware-software co-design of softmax and layernorm for efficient transformer inference,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.383466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:33.859677Z digest=sha256:a64f67f28d9894e2a645eb29fd354aee31ecdfbeeed31eb92f73976edb76f972

Observation 2079e212-5704-4a29-b94c-6110d504a9e2 · outbound

This paper cites Smoothquant: Accurate and efficient post-training quantization for large language models,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Smoothquant: Accurate and efficient post-training quantization for large language models,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.974593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.974593Z digest=sha256:6b431741c8f8bfd60bdb0301f4514194d9daf8acec7408a73f0559dea2a71645

Observation fb639e50-da2a-4437-85b3-05ef8531e8da · outbound

This paper cites Llmcompass: Enabling efficient hardware design for large language model inference,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Llmcompass: Enabling efficient hardware design for large language model inference,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.216617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:34.118676Z digest=sha256:9637b0f150b02fe0b0608adb6f6b7ac4a865dce5aee44fd71fa8caab61bc8a15

Observation be55cd61-3724-4471-a10a-d6df02d4d13d · outbound

This paper cites Atom: Low-bit quantization for efficient and accurate llm serving,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Atom: Low-bit quantization for efficient and accurate llm serving,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.002544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T18:14:34.248578Z digest=sha256:a32c5168cf2f7c3bd40cf84892d788c9c421a29c8b8bd79713f47c05befc6caa

Pith citing papers

No inbound Pith citation observations are available.