Pith. sign in

Paper Citation Record · LEDGER

Intra-Layer Recurrence in Transformers for Language Modeling

As of 21 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2505.01855.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.01855 v2

Coverage vector

measured 19 of 19 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T04:12:36.460382Z

measured 19 of 19 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

19 of 19 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 650b011a-e6ec-4ed4-9724-6b431c81b4e7 · outbound

This paper cites Attention Is All You Need.

Intra-Layer Recurrence in Transformers for Language Modeling Attention Is All You Need

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.359553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.359553Z digest=sha256:bda1ed5da87541d9ac38cc5a7c36ea8a250e35df03abbd95e6f650a4c9680d2f

Observation 457b876e-4083-45e2-ba3e-0ffd5e664dfc · outbound

This paper cites Language Models are Few-Shot Learners.

Intra-Layer Recurrence in Transformers for Language Modeling Language Models are Few-Shot Learners

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.365389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.365389Z digest=sha256:3db87f48f4ecaad59f824cd4b4f4ef7ed7bf83dcde3effc2077265b4a27addf0

Observation 73369a2f-3d35-4099-8073-6cad5bd82b9d · outbound

This paper cites Universal Transformers.

Intra-Layer Recurrence in Transformers for Language Modeling Universal Transformers

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.370559Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.370559Z digest=sha256:c7a4d4c6ea7ea4bba8d36a1653d7457be10211afc353474c9f2df5670a658277

Observation 0774c4e8-00cc-4e04-a25d-31b31e81b1e0 · outbound

This paper cites Looped Transformers as Programmable Computers.

Intra-Layer Recurrence in Transformers for Language Modeling Looped Transformers as Programmable Computers

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.376248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.376248Z digest=sha256:7a8c018aeea2ec7373dc10a94755737c231e3475157c923b7b3ecfd104a76919

Observation 6054bce5-4cd7-4ef5-9257-1e454c7897d0 · outbound

This paper cites Looped Transformers are Better at Learning Learning Algorithms.

Intra-Layer Recurrence in Transformers for Language Modeling Looped Transformers are Better at Learning Learning Algorithms

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.382037Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.382037Z digest=sha256:21a8c7c6072ab82caf354addddfc31216fd663b8d8f19f7067cd7c69b8209c4d

Observation 0f7f533e-c6a0-4330-876e-f23935ea085e · outbound

This paper cites Looped Transformers for Length Generalization.

Intra-Layer Recurrence in Transformers for Language Modeling Looped Transformers for Length Generalization

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.387945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.387945Z digest=sha256:662f2ecdc9f620e4962ddeeb59233de0e5eb915f7db75363aa3444a5d0fac274

Observation 303aaed1-9f4c-4b57-b6ad-7d9bd5573bbb · outbound

This paper cites Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach.

Intra-Layer Recurrence in Transformers for Language Modeling Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.394330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.394330Z digest=sha256:3e040b8b262f11abaac7d51a1984a45097e6979df7cbe7b7a13308b11f494fec

Observation f8491164-26e3-4e15-ae0a-a04d60463797 · outbound

This paper cites Longshort-termmemory.

Intra-Layer Recurrence in Transformers for Language Modeling Longshort-termmemory

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:12:36.824619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-16T04:12:36.400546Z digest=sha256:6befca336cab7f341aab985e0e6cac934fc63a4e4fd5e19c49dab8ba4809118b

Observation 0398b6c7-4092-46b7-8c71-64dfe241238d · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Intra-Layer Recurrence in Transformers for Language Modeling BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.405588Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.405588Z digest=sha256:909c59737fd4af1e66790bc8db889bce8497d87cce87635ee1c97bbac22f6385

Observation d41e9df3-e36b-482b-8fac-fa0751b70b33 · outbound

This paper cites Lan- guage Models are Unsupervised Multitask Learners.

Intra-Layer Recurrence in Transformers for Language Modeling Lan- guage Models are Unsupervised Multitask Learners

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:12:36.806495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-16T04:12:36.410752Z digest=sha256:0c638a5a417f2108e4485198045bf7e9139c54a59eeddf2d1ce0eba0fac19ecc

Observation 9bd32c0f-b4c7-41db-8958-50c47f2a6c80 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Intra-Layer Recurrence in Transformers for Language Modeling LLaMA: Open and Efficient Foundation Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.415621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.415621Z digest=sha256:a06ea6239ea997c33a4dd45a7d75bafe59e5b4620833c45612273d72fa8f2ec5

Observation 83f82706-ccc6-44b8-a1d9-7b99ee9393ae · outbound

This paper cites Revealing the Dark Secrets of BERT.

Intra-Layer Recurrence in Transformers for Language Modeling Revealing the Dark Secrets of BERT

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.421397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.421397Z digest=sha256:f3f92228e79fb74988dbfdf79632cce8c2d30215925dabcc193ca82972cd359b

Observation 0ce47652-879a-4a71-a231-ef3d072e594d · outbound

This paper cites Interpreting GPT: The Logit Lens.

Intra-Layer Recurrence in Transformers for Language Modeling Interpreting GPT: The Logit Lens

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:12:36.788514Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-16T04:12:36.426813Z digest=sha256:3d81d484d15cc069ed18972fd47c946b571edf4f7b8ac937c596463fc779fa59

Observation 386d908e-aba7-434c-b06b-941389143c0a · outbound

This paper cites The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.

Intra-Layer Recurrence in Transformers for Language Modeling The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.432391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.432391Z digest=sha256:bfa28c8284b0413bd75558d98ce9267c0e5aa53d2440aa9fb27938a3f34f3503

Observation c8a0b64a-9052-4ead-9a31-388d13306ebe · outbound

This paper cites an unresolved cited work.

Intra-Layer Recurrence in Transformers for Language Modeling Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:12:36.771444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-16T04:12:36.438489Z digest=sha256:d3417f5551335031d3014511f0cdaeb47361c42f7500c5185f9a4cfd7697252e

Observation 2848ffd2-5aa2-4180-a268-0ce3fe7ab71a · outbound

This paper cites RoFormer: Enhanced Transformer with Rotary Position Embedding.

Intra-Layer Recurrence in Transformers for Language Modeling RoFormer: Enhanced Transformer with Rotary Position Embedding

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.449702Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.449702Z digest=sha256:ff47c18f7a245dab7a82ef2710a80c97aef53bbc98850ea409c93563f04d0447

Observation 8e66d75b-9b58-4270-b52f-2d456d75093a · outbound

This paper cites Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation.

Intra-Layer Recurrence in Transformers for Language Modeling Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.454931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.454931Z digest=sha256:2d53e2d51b4d84eda8c78164904ff38cada71edbb4b6564a15918196c9952e22

Observation e1634db2-5f44-4a16-b554-c8d24da1ffae · outbound

This paper cites Training Compute-Optimal Large Language Models.

Intra-Layer Recurrence in Transformers for Language Modeling Training Compute-Optimal Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.460382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.460382Z digest=sha256:9814d1719bb12ad00f57a3e81e413583c51aab1dc94ba27db867708abfeee61b

Observation 48ce3fd7-76b5-4b1b-995d-8d6f441ce078 · outbound

This paper cites The Impact of Positional Encoding on Length Generalization in Transformers.

Intra-Layer Recurrence in Transformers for Language Modeling The Impact of Positional Encoding on Length Generalization in Transformers

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-16T04:12:36.443778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:12:36.443778Z digest=sha256:9c83e274763aad1ff8ef10266bbf241799c2db46c0c55762fa9ca7cfc9a30cc8

Pith citing papers

No inbound Pith citation observations are available.