Pith. sign in

Paper Citation Record · LEDGER

Provable Knowledge Acquisition and Extraction in One-Layer Transformers

As of 24 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2508.00901.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.00901 v4

Coverage vector

measured 57 of 57 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-21T23:05:56.687644Z

measured 60 of 60 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T06:55:10.121913Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-01T17:35:51.333328Z

Reference resolution

57 of 57 outbound references displayed

  • verified exact16
  • verified fuzzy28
  • unresolved12
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5863d64c-f89d-41e6-89d1-13d758384f0f · outbound

This paper cites Transformers learn to implement preconditioned gradient descent for in-context learning.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Transformers learn to implement preconditioned gradient descent for in-context learning

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.207862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:e8e916327d843395042ed5d0e4815002eff8e2696b69a9edc0df2407c4ff7c0a

Observation 9263cb36-40c2-47f6-b769-3111ece9d798 · outbound

This paper cites Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.837889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:79af325957c9b3a3cdcb9a154c5e96a2cb92d5fa96892fc148905c54ea312d6f

Observation 0b250b3e-629d-4e98-a566-dbccacca7cfe · outbound

This paper cites Physics of Language Models: Part 3.1, Knowledge Storage and Extraction.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Physics of Language Models: Part 3.1, Knowledge Storage and Extraction

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.869355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:ce0697bc1dd44efee38da49b4df05835c1670889dd88f19c65a514f6e05dafc6

Observation 52ce4e83-416e-4755-9181-98348147bcb4 · outbound

This paper cites Birth of a transformer: A memory viewpoint.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Birth of a transformer: A memory viewpoint

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.205887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:9050db52b23389f685f74f83fd139b056ab1080f819bedba24bf474d03439684

Observation 84d2161e-a267-429d-8f19-ece9b342cb19 · outbound

This paper cites Language models are few-shot learners.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Language models are few-shot learners

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.167736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:558684817872ce5eb9295e4e5d3fce5a5e02f25390ec4cc64d57aba61e449a28

Observation e3e4f27d-6cd1-488b-ac03-dc1803f1a87a · outbound

This paper cites Scaling Laws for Associative Memories.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Scaling Laws for Associative Memories

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.862743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:493a15818825f93c3c322b01a19d1241cf7334425a1cefe2ffc2bee6321d0313

Observation 062bd6b0-43a0-4f38-a1a9-a41b7d86e4b3 · outbound

This paper cites Learning Associative Memories with Gradient Descent.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Learning Associative Memories with Gradient Descent

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.879130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:d8e9dd570e2a721029f8ca29c09cdcb706b1af4f70d524307ce334fadde3420c

Observation bc3e7a8e-b5b9-4dd3-8e8e-5a2025c77776 · outbound

This paper cites Benign overfitting in two-layer convolutional neural networks.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Benign overfitting in two-layer convolutional neural networks

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.159784Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:e9a2a9cae3acc5dc41507b57965820756205e49b74d4d8eb0d44bdd03eb1f2d7

Observation 5ff181a0-5d14-4ec2-a864-d3ac0d70de10 · outbound

This paper cites Towards understanding the mixture-of-experts layer in deep learning.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Towards understanding the mixture-of-experts layer in deep learning

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.173575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:582b5562580f00e254a35cd26d07ce33c8063d605606be386471da87585450a0

Observation 1a7b7cd7-c4d6-4a78-9f4e-10c11430db8b · outbound

This paper cites Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.852070Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:29f5d96af434e4339908edb19e8b1b532f780d4f42ad1db43eedfc939c9e5d65

Observation 82df89cf-70ca-4945-b7ec-772d03367ac6 · outbound

This paper cites Transformer Feed-Forward Layers Are Key-Value Memories.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Transformer Feed-Forward Layers Are Key-Value Memories

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-21T23:10:44.875465Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:0dd23b7c15999e03e14089a5773e92d4da3e2323bc886346665adedd9e0b0372

Observation c337a012-9ada-484b-bc02-887e77929c3e · outbound

This paper cites Understanding Finetuning for Factual Knowledge Extraction.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Understanding Finetuning for Factual Knowledge Extraction

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.845010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:71d8cb5665ee78d7f39792a28523f239cab6047ea5dd822be978a49496b90eb6

Observation c54b138c-578a-4ea6-9a19-c6b325a07410 · outbound

This paper cites The Llama 3 Herd of Models.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers The Llama 3 Herd of Models

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-05-21T23:10:44.885336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:661baa47abb2808ef8a5d7a0843f0028c73a993e6f1a020c62abdd2439fa9a01

Observation c79b9456-d1d4-4a60-80d9-326a67f33907 · outbound

This paper cites In-Context Convergence of Transformers.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers In-Context Convergence of Transformers

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.840921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:c07ec3cf883d32bab9eb146887369c4f3835de52856d3e728dac3f685b1aa8d4

Observation 17e089b1-a4a6-4f41-adeb-e1763392258c · outbound

This paper cites Vision transformers provably learn spatial structure.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Vision transformers provably learn spatial structure

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.127250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:450034aea591ae04f0e206707330a6b48a8a0de960710c5937bae9b480eed749

Observation 693b6d58-a4b3-4cb6-aa09-c9b8cd74746d · outbound

This paper cites Unveil benign overfitting for transformer in vision: Training dynamics, convergence, and generalization.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unveil benign overfitting for transformer in vision: Training dynamics, convergence, and generalization

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.177731Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:fc8c1969c5a8a6ea1dc313174f4f89addc765629be2181ef68679e6f7065910d

Observation 7cc9718f-71dd-49ee-89bb-c509c88c97f0 · outbound

This paper cites Optimal memorization capacity of transformers.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Optimal memorization capacity of transformers

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.169591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:3e8918736af236895c805ae5faa138a264c9c2809f5a98af7171bf58f210a5c4

Observation 8a33e6e2-c8c1-41bb-a24d-1498eb4cb55e · outbound

This paper cites Large language models struggle to learn long-tail knowledge.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Large language models struggle to learn long-tail knowledge

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.180067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:e081413d058bc5ffae33babd3fe15bcc85dbc10aa208a297de75199f6f162fd2

Observation efcd39cd-ba49-4196-8bd6-e7193b11aac7 · outbound

This paper cites Provable memorization capacity of transformers.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Provable memorization capacity of transformers

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.140595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:ac61e9591b1f1d087531b080f88c1502897d32dae4cef429ca937675cefd8ab5

Observation 3d6a51fe-209e-450a-8266-d5203507242a · outbound

This paper cites Benign overfitting in two-layer relu convolutional neural networks.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Benign overfitting in two-layer relu convolutional neural networks

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.143623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:1ebdd58d2f9e0cd241340543e28d819fb4340278610390fa59cf29efd491898e

Observation c7a0fcf5-efa5-40d6-a60d-f92613bee5aa · outbound

This paper cites Deduplicating Training Data Makes Language Models Better.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Deduplicating Training Data Makes Language Models Better

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-05-21T23:10:44.865987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:d34f727e6fb9b1acd76a3ce70a8062e36116d8f0acdbebbb6885addaa6000162

Observation cd2cff31-1120-40a7-b9ec-f60124cdf36e · outbound

This paper cites Next-token prediction capacity: general upper bounds and a lower bound for transformers.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Next-token prediction capacity: general upper bounds and a lower bound for transformers

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.882273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:15c652922e0addeadc1d1042708bd128bb54f2c21013d96738a71d31c9314284

Observation 98571dc9-753e-4717-8ae1-ea886bd49bf9 · outbound

This paper cites One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.859425Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:91dafae64e4cb2d1329abc67177443df9196986d3b61eee746ccfbc37ff09200

Observation 6bdd94b1-7785-4547-9142-481f60980056 · outbound

This paper cites Memorization Capacity of Multi-Head Attention in Transformers.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Memorization Capacity of Multi-Head Attention in Transformers

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.872367Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:4a81006588cc31ea7d9177ca9d2ea2d790a27618247d74058819c336b59f6c5c

Observation ed10931f-24e5-4a47-b46f-53eed430d8a9 · outbound

This paper cites When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-05-21T23:10:44.834102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:b0384c5e0742477873fba4ddcb0c2b5d1341f0f23f9cc4a67a9e39de06f9d9e0

Observation 2b5b6738-1257-4614-84fb-2579408cb3cf · outbound

This paper cites Locating and editing factual associations in gpt.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Locating and editing factual associations in gpt

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.148566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:35cf12f9cc3dc45105253d774b63cb0856652751864138f07def1c0cc017c89c

Observation 0f83e290-35b7-4ccd-80a0-69c93bc572ee · outbound

This paper cites How Transformers Learn Causal Structure with Gradient Descent.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers How Transformers Learn Causal Structure with Gradient Descent

Reference 27

Resolution
metadata mismatch
arxiv_id, observed 2026-05-21T23:10:44.830980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:6f6aeb0139156c1dbc36faea3763f4dc2e4732547a842a615c9d5c1f36114c2e

Observation f6500055-9d8b-49dc-8dcf-2c18cfa67d4d · outbound

This paper cites Understanding Factual Recall in Transformers via Associative Memories.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Understanding Factual Recall in Transformers via Associative Memories

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.855297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:6da7fd122d2738d14f48aa1b11733eeaab692b1a4f09eae8b55faf6a838d2cca

Observation e3872ae8-077c-42e0-a6ef-ff13c614f70c · outbound

This paper cites Language models are unsupervised multitask learners.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Language models are unsupervised multitask learners

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.153397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:46189cee8d58689b0bdae6fb8b8f2ea576b8434c84c029e3bc87dba1ca9784a9

Observation db597d97-b182-46ec-9c2e-1f305677ac0e · outbound

This paper cites Data augmentation as feature manipu- lation.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Data augmentation as feature manipu- lation

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.165587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:a65bbfff5a0c0bcfd60476eef54834b23a9fa1dc11aa310405f19fb99ec614ce

Observation e2280d1c-a3a4-42d7-a954-3856dbd84e58 · outbound

This paper cites Scan and snap: Understand- ing training dynamics and token composition in 1-layer transformer.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Scan and snap: Understand- ing training dynamics and token composition in 1-layer transformer

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.203938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:e8d5b7d765191332c2eacb007afae00ea7a4cbb3d7aec8b4834a48dba4de3cc9

Observation 59d62af1-a3cd-4273-bb39-e1f1000f3757 · outbound

This paper cites JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:10:44.848215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:b28eae032e9032a603fd34aad7b005f048701f7747f3a693ae8e6cd4b49079f6

Observation 9de1d0b7-1632-483d-a5e2-0f27b96f5bb4 · outbound

This paper cites Rethinking benign overfitting in two-layer neural networks.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Rethinking benign overfitting in two-layer neural networks

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.193881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:f1cc5c7db943bc923df47735aab3874134b4933242ad54cb1703fbb1b179a8b8

Observation d245bf62-821a-4499-8cb7-f001155fdc56 · outbound

This paper cites Knowledge circuits in pretrained transformers.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Knowledge circuits in pretrained transformers

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.192034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:8fae2fa46280988b876bc8633c28da4486056b4a09a4c8017c332e84ac5dfbc8

Observation 98967ec6-cae9-4447-a2cc-23f063076a39 · outbound

This paper cites Are transformers universal approximators of sequence-to-sequence functions? International Conference on Learning Representations.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Are transformers universal approximators of sequence-to-sequence functions? International Conference on Learning Representations

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.171530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:43627d197849375395f34702380c983f5c944b3ac84933a97facc2e235e2d1f5

Observation bf517ccc-3fbb-4f49-9f22-7fd04b8cbda4 · outbound

This paper cites Trained transformers learn linear models in-context.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Trained transformers learn linear models in-context

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.132137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:cf024dd5b37e2ea268d478f0be8520980d41b1fabdcd1c85fa09496479187f0a

Observation b114abe6-ebd9-491d-8722-854deeab8a7a · outbound

This paper cites Towards a theoretical understanding of the’reversal curse’via training dynamics.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Towards a theoretical understanding of the’reversal curse’via training dynamics

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.136569Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:5621303a3a298239cdb5712921f27e78409a66315583aebc51e0465ec903936c

Observation 2d86208f-6a23-4cea-b185-d9698c641861 · outbound

This paper cites The benefits of mixup for feature learning.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers The benefits of mixup for feature learning

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.175545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:0edb0440aaf36d33628e36bab9f13d9798aaf7728682faf26ccddf0e31a9e1d7

Observation 9275d688-f560-42b3-a53c-f2368f50236b · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.138663Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:e8a0d3dcbb81691bf28ccce6c592c8d3064d62b1de4ce4889a194b11b87e5c4a

Observation d3d1eaeb-e6a3-4c63-8fb3-99ab63d3c1c6 · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.146406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:0779d2ab56bda258a28b1cd7ea8c83b5dc71344c534dcf682af1274c4d6f235b

Observation 295216a7-5bf3-460f-b129-6ce56fce8e39 · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.195818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:2aed07523ea6aaaf5355754b4fc7b66dadf534f2ad76e22fa98a373095ef9f69

Observation a625a410-8c41-4c57-bdc4-4e2ae50bf63e · outbound

This paper cites Based on the sentence set T , we construct the pre-training dataset as follows: For each (sj, ri, aj) ∈ T.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Based on the sentence set T , we construct the pre-training dataset as follows: For each (sj, ri, aj) ∈ T

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.190128Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:ec3d40fa67a57f2574de4e3a9e9f571a2428fb79ac0f5dfcad8b28d55b216bba

Observation 98e94caf-d04e-4d28-abd9-8121290fc499 · outbound

This paper cites We construct the fine-tuning dataset and the test dataset as For each (sj, ri, aj) ∈ T.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers We construct the fine-tuning dataset and the test dataset as For each (sj, ri, aj) ∈ T

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.163711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:9e0f914695438074ec9be5d159b0bbc58e6f8ac40e7f305f85460964a015b2c4

Observation fba0194a-03a7-47c2-9c64-8df93d491ef8 · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.155444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:f7d816c1e79ba7dda3319f9831cf2ce310a5313b8d1a7adc23239eea46488bba

Observation dbbb93a2-a461-48f3-9f98-37b7fea1d8a7 · outbound

This paper cites We assume all token embeddings— sj, ri, aj, for all j ∈ [N] and i ∈ R are generated from random Gaussian distributions N (0, σ2I).

Provable Knowledge Acquisition and Extraction in One-Layer Transformers We assume all token embeddings— sj, ri, aj, for all j ∈ [N] and i ∈ R are generated from random Gaussian distributions N (0, σ2I)

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.182199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:74cb8ed05d2bf5bdf5977f7642d7af7fb82095677d64c788454f54ce658659e3

Observation ee853f0d-b7d9-4e61-b8b9-7532c6fe971b · outbound

This paper cites nX i=1 I(j ∈ A i) ≥ K 2q n # ≤ exp − nK2 2q2 . (44) 25 Proof. In each time i ∈ [n], a number j ∈ [q] has probability K/q to selected. By Hoeffding’s inequality, we have: P.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers nX i=1 I(j ∈ A i) ≥ K 2q n # ≤ exp − nK2 2q2 . (44) 25 Proof. In each time i ∈ [n], a number j ∈ [q] has probability K/q to selected. By Hoeffding’s inequality, we have: P

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.200223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:618172686df388db9e022ce7fa4164fd79874d1ce60bb468258d67acdc61d4a6

Observation 7aa70d31-1560-4218-bea5-e5de6f120a3d · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.209658Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:89e3630f186bd9d489f22c155b503440f09d0988c7fec459a6f077f085c12f95

Observation 7e2e6550-6ab9-478a-9902-e9fcbb57cf09 · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.202026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:1d663e274a45ff5d019224ccca50d847861ced6d7ae7fa934d2d7508f4da6935

Observation 55e05847-3ee1-459b-8885-5013041cf37f · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 49

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.161723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:b5d7ca061ad123d47bf5e7fbd813e2f26582e87688e6c74990d4e15598896e87

Observation 583ff63e-d385-4041-aa99-d694cde1589f · outbound

This paper cites (70) Proof.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers (70) Proof

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.186290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:cf7610afeae9e16f8689756eed86b58be40daeb4367a4497fcf4386e3068b40b

Observation 98690a49-de06-4405-9f29-1755c3d1739b · outbound

This paper cites After 2 iterations, we have 1 m mX k=1 ⟨w(T1) I(aj),k, Ξ(T1)([o s j ri])⟩ = O λη1dKs(j) nm.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers After 2 iterations, we have 1 m mX k=1 ⟨w(T1) I(aj),k, Ξ(T1)([o s j ri])⟩ = O λη1dKs(j) nm

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.197902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:7877cda5937f1e05d20bfd5e904a2ee74338308b10136a38adb8a067754e75c1

Observation 555e56af-0ffe-4acf-8c6a-d9485ad77dfb · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.184027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:508025a13c9a52c08eda065dbfc5624e5ce67c3fe10e9381df3a4b078240f763

Observation 9fd531e6-32e7-4b0a-ab5c-69c3a89e4746 · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.188138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:6a65a8adb833ccc02430f94fb07710591d1862d85fd167d6780b0929d05b37e0

Observation 61a7c4a0-89ef-441d-ae30-9c6c76589b08 · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.150586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:3a1932529a5ffcd55cf3f25c7f4734878c7fe24fbedd970d10ae47011c947e2d

Observation bd73b812-2074-42fe-857c-c753a89ae53f · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.157677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:df087b2cb5121d6e237fd575eb085b448216d293fbabffd1483a0b00592bc3d5

Observation 9de4e054-075a-4007-952f-193140735582 · outbound

This paper cites an unresolved cited work.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-05-21T23:15:45.129836Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:6543d095fa984cd7b3a5aaf6b6c2939aee4a44dd04d5bb1737b7a64f4bc5a10a

Observation 4f5e8f00-9d7e-4d16-9b23-7fe38d5068fd · outbound

This paper cites dX j=1 σjujv⊤ j # i , [RA1(G(tf ))]i = σ1u1v⊤ 1 i . (216) Taking the L2 norms, we have [G(tf )]i 2 2 =.

Provable Knowledge Acquisition and Extraction in One-Layer Transformers dX j=1 σjujv⊤ j # i , [RA1(G(tf ))]i = σ1u1v⊤ 1 i . (216) Taking the L2 norms, we have [G(tf )]i 2 2 =

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T23:15:45.134512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-21T23:05:56.687644Z digest=sha256:a14bafafc603ee971c642fec4ff70b908640a0a10a1d303ed872f0b2d8bdbf7a

Pith citing papers

Observation fca444f4-1977-4d43-8344-ba420ef3a8f3 · inbound

Procedural Pretraining: Warming Up Language Models with Abstract Data cites this paper.

Procedural Pretraining: Warming Up Language Models with Abstract Data Provable Knowledge Acquisition and Extraction in One-Layer Transformers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T06:55:10.121913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:55:10.121913Z digest=sha256:b7a2d27003bf444a24b678e28e1930f04944cf21a1013d835ff628634ff6e3e2

Observation 193e0fc8-0d05-4f64-bd4c-868e6ee334f4 · inbound

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models cites this paper.

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models Provable Knowledge Acquisition and Extraction in One-Layer Transformers

Reference 103

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T17:35:51.334692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-29T03:35:34.594617Z digest=sha256:66a5b7bda64cde95bd7505210c79a497907e159c200748474625d31e1321837c

Observation 64ea49a1-5f14-4feb-9e8f-c4367f115cea · inbound

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models cites this paper.

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models Provable Knowledge Acquisition and Extraction in One-Layer Transformers

Reference 55

Resolution
metadata mismatch
local_arxiv, observed 2026-06-30T09:34:34.439000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-30T09:32:59.824110Z digest=sha256:65235c7897f211b774d4001b9d645e2ddad4db8509dcd6bc01c7fa3471118243