Pith. sign in

Paper Citation Record · LEDGER

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer

As of 11 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2501.15570.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.15570 v1

Coverage vector

measured 12 of 12 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T14:12:09.330745Z

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

12 of 12 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved11
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fd45bb74-2fdf-41ca-9b0c-e68ed34e2115 · outbound

This paper cites Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.274935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.274935Z digest=sha256:cb7ebb8a329e1723ea0fb4bf510868db3909beb9c9661675c279c2df26b8e7d2

Observation 3cf72c39-56e3-4580-92ce-4b5fb40f27dd · outbound

This paper cites Hymba: A Hybrid-head Architecture for Small Language Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Hymba: A Hybrid-head Architecture for Small Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.285754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.285754Z digest=sha256:1abaff5f334f7b71959f4041324c461771f63e96643330bcb30268012af42fff

Observation 18d5dccf-1765-4ed5-81de-87a540fed9b1 · outbound

This paper cites Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.290924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.290924Z digest=sha256:1c90c7a163d6a1121e7c3afd5e52993cd8cd261e0df93b8841dfbda27839f1d5

Observation 78e15a5c-d049-4bb8-9e1a-f3d13f650b40 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.295989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.295989Z digest=sha256:02ef8679e225e02da02acab4ca85648a0d161a2ddd245c475167393f13c413bd

Observation 24283ca9-3110-4d8f-8cd4-f7c4a5bee0f7 · outbound

This paper cites Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.305901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.305901Z digest=sha256:a87f5e7bb96cbf3975a2300c626407f1fcdf22765fa54ac2a7c63f6e02a95f1c

Observation f7266d44-4367-4cd9-a15a-43d57ceda7f9 · outbound

This paper cites Does Representation Matter? Exploring Intermediate Layers in Large Language Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Does Representation Matter? Exploring Intermediate Layers in Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.311351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.311351Z digest=sha256:bf2f7b964506e17331d6eb2373649a8af39bcb2fd81d201b1bea779adf89afe5

Observation e9e7356a-b58e-43ec-9070-b21da643d96d · outbound

This paper cites The Mamba in the Llama: Distilling and Accelerating Hybrid Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer The Mamba in the Llama: Distilling and Accelerating Hybrid Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.316087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.316087Z digest=sha256:2ef1dd3d33a4e40117a501b76a75e8c09eedd65148d0d8a8ae5bb60f6f0ffcaf

Observation dfdf35f7-d924-4c10-923a-abf2a84ecc06 · outbound

This paper cites A Survey on Knowledge Distillation of Large Language Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer A Survey on Knowledge Distillation of Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.321052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.321052Z digest=sha256:dc5ba53041384acf6c8f9b977804f4932cc586dd19ce19ad60a8c2b4692eb4cf

Observation 1b88f967-2e68-46ea-b850-3de81b0e9cfd · outbound

This paper cites an unresolved cited work.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-10T14:12:09.524148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-10T14:12:09.330745Z digest=sha256:be9a5a1eea03ff949f42b88376e0588ae88e903701cc983ad384ac5504c2c018

Observation 7d0bac67-8be8-45dc-b788-465f0ac245b9 · outbound

This paper cites The Illusion of State in State-Space Models.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer The Illusion of State in State-Space Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.300831Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.300831Z digest=sha256:ce91b309e647dda63cd5dbbbb5c5aeb733306a503a743726adbe09046c78c595

Observation fe699a78-8f89-4648-b91c-69a777607587 · outbound

This paper cites Parallelizing Linear Transformers with the Delta Rule over Sequence Length.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Parallelizing Linear Transformers with the Delta Rule over Sequence Length

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T14:12:09.325861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:12:09.325861Z digest=sha256:75bada1305a484a04473a002b6d203d38559a8cb32d9792d94616a01e9797caf

Observation 78a674c9-4d27-41dd-8a16-d7a1c867bfe3 · outbound

This paper cites Castin, P.

ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer Castin, P

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:12:09.539210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-10T14:12:09.280969Z digest=sha256:471bc5ed55bf7f5e1b9857a6642267f2df5eb54755fff226b1cf771249273a13

Pith citing papers

No inbound Pith citation observations are available.