Pith. sign in

Paper Citation Record · LEDGER

Crisp Attention: Regularizing Transformers via Structured Sparsity

As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2508.06016.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.06016 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T23:03:07.949630Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

23 of 23 outbound references displayed

  • verified exact1
  • verified fuzzy16
  • unresolved6
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7fffd0f1-c1c2-4559-aff7-3ba47c27c151 · outbound

This paper cites Efficient Transformers: A Survey.

Crisp Attention: Regularizing Transformers via Structured Sparsity Efficient Transformers: A Survey

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:05.668093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:05.668093Z digest=sha256:76b1c216c0b678d27b4dd76ca194046776f0dc8f2735b6690fb0bbfea89f4d63

Observation 5f24f36c-f3d7-40fd-8f01-535d012ff957 · outbound

This paper cites A Survey on Efficient Vision Transformers: Algorithms, Techniques, and Performance Benchmarking.

Crisp Attention: Regularizing Transformers via Structured Sparsity A Survey on Efficient Vision Transformers: Algorithms, Techniques, and Performance Benchmarking

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.221239Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:05.749437Z digest=sha256:9a400a317eaac986ec660dbfd722a8154e1feb8110b864c2a149ffbbcb4a4219

Observation 76053760-67b4-4837-b54e-f599bb30a7ee · outbound

This paper cites A Comprehensive Survey on Efficient Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity A Comprehensive Survey on Efficient Transformers

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.205663Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:05.858961Z digest=sha256:490bdc38af22b868535c59d24348fbda52412872af9982f4c474741508896ba0

Observation 34f5365f-a17d-4889-929f-3de44ef7289b · outbound

This paper cites Generating Long Sequences with Sparse Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity Generating Long Sequences with Sparse Transformers

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:05.962611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:05.962611Z digest=sha256:6987f3d6dca5205b1cdae243ce6f6fc42c32f2af10bbc0791e51029ec8c16b15

Observation 2f40eee7-7f4d-48f0-bf3e-253f8a34a663 · outbound

This paper cites Linformer: Self-Attention with Linear Complexity.

Crisp Attention: Regularizing Transformers via Structured Sparsity Linformer: Self-Attention with Linear Complexity

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:06.089159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:06.089159Z digest=sha256:ae70af2e3545ac38a61af1efa1ecd0c577cdac7a41a7cfc729b0097436bcdc0c

Observation 1b0fa903-8afa-4b92-8e89-65e7e7487d76 · outbound

This paper cites Reformer: The Efficient Transformer.

Crisp Attention: Regularizing Transformers via Structured Sparsity Reformer: The Efficient Transformer

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.190725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:06.155923Z digest=sha256:e9afdb4d8867cfb37f51462b23be0611f34fca0a3fa60c873dff54b5d719adbf

Observation 4d1d91db-3b0a-4bf9-a6e9-ab09186e09f9 · outbound

This paper cites FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.

Crisp Attention: Regularizing Transformers via Structured Sparsity FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.174720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:06.247275Z digest=sha256:2f28699bc3b821bbc3e8a90afed017e5140af4be120acf352544082c9487c23b

Observation b5bd0adf-4c83-4337-8832-4cb18da2f8eb · outbound

This paper cites Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference.

Crisp Attention: Regularizing Transformers via Structured Sparsity Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:06.339230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:06.339230Z digest=sha256:72ab7961c94d7e0b7c54f4390a37e9ff802bb8b2292b88afeb75cea59c080c7d

Observation 4f4b114b-0756-4489-baf5-1fa75e11a079 · outbound

This paper cites TKwinFormer: Top k Window Attention in Vision Transformers for Feature Matching.

Crisp Attention: Regularizing Transformers via Structured Sparsity TKwinFormer: Top k Window Attention in Vision Transformers for Feature Matching

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:03:08.141171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:06.459688Z digest=sha256:67c48bf9e53c1ace967d49a916c600db6da52de18406ee737d9ea1977065080d

Observation 749df25a-84b9-4afc-b24b-fd98749a21e3 · outbound

This paper cites Optimal Brain Damage.

Crisp Attention: Regularizing Transformers via Structured Sparsity Optimal Brain Damage

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.158462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:06.534693Z digest=sha256:43d1a9010bdcdb7817e1e3727da3b662257bca8e5971916ac4f57b159483f9b2

Observation 1a8393dc-0b4b-4469-86c3-67fd192e9e16 · outbound

This paper cites Learning Both Weights and Connections for Efficient Neural Networks.

Crisp Attention: Regularizing Transformers via Structured Sparsity Learning Both Weights and Connections for Efficient Neural Networks

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.142970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:06.610248Z digest=sha256:9191dccc801a6e96ad135d6282eb9eeef3bfa78750bfb954d3ae675df5267942

Observation 647913a3-26cc-4b37-aeb7-5054b7fd23b9 · outbound

This paper cites Sparsity in Transformers: A Systematic Literature Review.

Crisp Attention: Regularizing Transformers via Structured Sparsity Sparsity in Transformers: A Systematic Literature Review

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.128210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:06.826890Z digest=sha256:18498273066d122c2a940c677e9bb0d87b7f9a0f6cb92a3e3061d75d20d24012

Observation da8118e9-8423-4fe8-aa3a-c625c09fdc46 · outbound

This paper cites Graph-based Vision Transformer with Sparsity for Training on Small Datasets from Scratch.

Crisp Attention: Regularizing Transformers via Structured Sparsity Graph-based Vision Transformer with Sparsity for Training on Small Datasets from Scratch

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:10.113318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:06.902196Z digest=sha256:c5311fa48a2957fdde4d49d325bef16beede785cc678bfcafaf09e315e49a2b0

Observation 40003f6b-26d0-4f5f-a1e7-c31c326c5863 · outbound

This paper cites Dropout: A Simple Way to Prevent Neural Networks from Overfitting.

Crisp Attention: Regularizing Transformers via Structured Sparsity Dropout: A Simple Way to Prevent Neural Networks from Overfitting

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.990591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.062723Z digest=sha256:3253c893c0fa0a841520fa184a5691d6c3fa191c0cd78f0da0ff55c635b0ea08

Observation 9cb59707-cc0d-4b93-a2d6-65fba0d82139 · outbound

This paper cites L1 Norm Regularization and Sparsity Explained for Dummies.

Crisp Attention: Regularizing Transformers via Structured Sparsity L1 Norm Regularization and Sparsity Explained for Dummies

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.721271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.170445Z digest=sha256:7690b413ca730abe8bbaa71e6970577ce082e96dcb608fa8ed2318dfbb3ad390

Observation 098f4f08-f02f-4eb7-8fab-1c0aa1301bbd · outbound

This paper cites Regularizing Transformers with Deep Probabilistic Layers.

Crisp Attention: Regularizing Transformers via Structured Sparsity Regularizing Transformers with Deep Probabilistic Layers

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.419354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.247530Z digest=sha256:8c26fcbe7aa898ffef3957edf6b157901d98730c112fdcca2a9fbcffb8e5b9be

Observation d861836e-8089-4566-beca-6917e7ef7dce · outbound

This paper cites Double Consistency Regularization for Transformer Networks.

Crisp Attention: Regularizing Transformers via Structured Sparsity Double Consistency Regularization for Transformer Networks

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:09.169349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.347374Z digest=sha256:9a460cf70294f2ee58759aac143a12a9cec5d186ee9960d22d64476c4c13589e

Observation e31e9b2d-2c6b-4703-ab7b-274c0b4f0c06 · outbound

This paper cites The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:07.440296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:07.440296Z digest=sha256:39dbbbd4741dabd0c32af445e5605cc87cd4dc54a3367ea06ef89627e8dae181

Observation 1a646dc4-551f-4f76-a7da-ce782628441c · outbound

This paper cites Efficient Algorithms for PDE Solving and Network Pruning.

Crisp Attention: Regularizing Transformers via Structured Sparsity Efficient Algorithms for PDE Solving and Network Pruning

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.881383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.548135Z digest=sha256:d5565dee4578eb9011033581fb56179b9a5d121e27d5324c7bb4b939957af25c

Observation 78f330da-2995-4fb3-94fa-4bbf9f978dde · outbound

This paper cites Memory-efficient Transformers via Top-k Attention.

Crisp Attention: Regularizing Transformers via Structured Sparsity Memory-efficient Transformers via Top-k Attention

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.696543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.634059Z digest=sha256:9673ece23bbbaada603025bd1bdb8a79dc5c6a346ede56123fc26e4d2ae3b564

Observation 1eb117d8-3312-42b3-84fe-11d6d8e5cbdf · outbound

This paper cites Sparse Transformer: Concentrated Attention Through Explicit Selection.

Crisp Attention: Regularizing Transformers via Structured Sparsity Sparse Transformer: Concentrated Attention Through Explicit Selection

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.517028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.735820Z digest=sha256:cf0953beb46235590d3c8cd709ca991a2125d44ca8f87727a6975f7703bcb141

Observation cd89a3ed-35f5-434a-b3af-665cc7116768 · outbound

This paper cites Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers.

Crisp Attention: Regularizing Transformers via Structured Sparsity Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T23:03:07.855081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:03:07.855081Z digest=sha256:531012327e2c834209dad2942db01803503ff0ab9c6513e12a8b32ae97d12e22

Observation f2c1e29f-26df-434b-a2c8-51b13e2c95a6 · outbound

This paper cites Zoology: Measuring and Improving Recall in Efficient Language Models.

Crisp Attention: Regularizing Transformers via Structured Sparsity Zoology: Measuring and Improving Recall in Efficient Language Models

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:03:08.364987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T23:03:07.949630Z digest=sha256:a84300d292ea89b5c18b2dda3db2761db77a491441ac16a7e6af1ef3d290f433

Pith citing papers

No inbound Pith citation observations are available.