Pith. sign in

Paper Citation Record · LEDGER

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge

As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2505.16178.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.16178 v2

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:12:00.573379Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T20:53:40.719452Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-04T14:19:53.912897Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact0
  • verified fuzzy44
  • unresolved9
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b3b0063e-b53a-4442-9ee6-3de35ee46ad9 · outbound

This paper cites Evaluating correctness and faithfulness of instruction-following models for question answering.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Evaluating correctness and faithfulness of instruction-following models for question answering

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.909216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:55.400714Z digest=sha256:f1247ef9aada788d0650734a2e1e3693f2d65bf19af043b1da8f95959020308e

Observation 9cc26fe9-fad4-4789-b343-d91b52fa66f7 · outbound

This paper cites Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Llama 3.2: Revolutionizing edge ai and vision with open, customizable models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:55.475764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:55.475764Z digest=sha256:977aba01b3912c829e44a3991061e11c3d5d0acf1884ebc1dec18077ef69fb74

Observation e41ee26d-26d9-4ee4-a093-efb3b83ee40f · outbound

This paper cites Physics of language models: Part 3.1, knowledge storage and extraction.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Physics of language models: Part 3.1, knowledge storage and extraction

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.881252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:55.592211Z digest=sha256:a6a258089d15874c1a9099a979e9c0cca6b5dee34b38b127fde5918bf489b3f3

Observation 13869605-8315-40d7-b021-776c72b2b662 · outbound

This paper cites Physics of language models: Part 3.2, knowledge manipula- tion.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Physics of language models: Part 3.2, knowledge manipula- tion

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.865284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:55.743068Z digest=sha256:65154883c8b096a5ca93ea35f08694d6f23e7a3f9dfcd6a3a479dcb2812630c5

Observation 59b507d6-e94e-4515-be59-e36ee589cdf8 · outbound

This paper cites Towards better understanding of gradient-based attribution methods for deep neural networks.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Towards better understanding of gradient-based attribution methods for deep neural networks

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.849487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:55.839999Z digest=sha256:5dadb44e622e6aa761f8ff3b14cd9a67bdfba7dd62b56463e52c8be3fb9f6bde

Observation bb00f3c9-52e9-4000-9e30-a8303963cfb8 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:55.947350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:55.947350Z digest=sha256:a159d370413a2f9a9ab97a1987eb3db5f16e42e2b7bc3a35c304de934055cf3f

Observation 2d020124-f740-4d2c-9053-8bb795e7911c · outbound

This paper cites Pythia: A suite for analyzing large language models across training and scaling.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Pythia: A suite for analyzing large language models across training and scaling

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.833474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:56.060845Z digest=sha256:6139915a9d196190e48ec6e9d155de2997c84e95ae82708d302601b44c73bd65

Observation 195992c6-268c-442d-8397-2f86538a3eff · outbound

This paper cites Instructpix2pix: Learning to follow image editing instructions.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Instructpix2pix: Learning to follow image editing instructions

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.817716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:56.209417Z digest=sha256:74649e466e8996028b8d9659db40b4a4a2338a3a72a67535f92c19cb25ae3dce

Observation 2360e71c-2c40-47e3-ae0a-0bc67a629fff · outbound

This paper cites Causal scrubbing: A method for rigorously testing interpretability hypotheses.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Causal scrubbing: A method for rigorously testing interpretability hypotheses

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:56.397434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:56.397434Z digest=sha256:b70cdda63a2de2964c57a3d952a1b8948df056816343e58269a8d343d9a84342

Observation 6a5d02bf-22bf-4698-b299-fe3e35741a63 · outbound

This paper cites Journey to the center of the knowledge neurons: Discoveries of language-independent knowledge neurons and degenerate knowledge neurons.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Journey to the center of the knowledge neurons: Discoveries of language-independent knowledge neurons and degenerate knowledge neurons

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.790929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:56.530960Z digest=sha256:58ec3552136f09c677de3559ac1cd4e1ad822a4090d55e14a2fbd151333c407a

Observation 8d2b9e9e-e811-48bf-9e9b-738bea0e7407 · outbound

This paper cites Instruc- tion pre-training: Language models are supervised multitask learners.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Instruc- tion pre-training: Language models are supervised multitask learners

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.772342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:56.613248Z digest=sha256:b17e86181f1e44ccf1f69f2d89f0dafb026821af17b682bc7f333d33fe182344

Observation 4c73c785-e1a6-4ccb-a084-1ae57e33ea00 · outbound

This paper cites Zhao, Yanping Huang, Andrew M.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Zhao, Yanping Huang, Andrew M

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.756083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:56.734483Z digest=sha256:5bd643e2b7407e26b29e349d3ab8946e55d34dfd36c31208a1d9dfd15160af50

Observation dd64acd9-f7d6-45cb-aa59-4472c17c6751 · outbound

This paper cites Towards automated circuit discovery for mechanistic interpretability.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Towards automated circuit discovery for mechanistic interpretability

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.740201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:56.810407Z digest=sha256:8a13875070d2053b23270958664f40890bd32219fa71698629a99b4813581f06

Observation 7b27cf0d-cc75-4629-9085-66d95b2803c0 · outbound

This paper cites Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:56.908529Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:56.908529Z digest=sha256:2912f9fd2ef89f3c29fd33829fe71ab3e711ca3a90d4085f08dc9c768aa9a896

Observation 9897528a-d134-4077-9dbb-06064f5b0d74 · outbound

This paper cites Knowledge neurons in pretrained transformers.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Knowledge neurons in pretrained transformers

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.712936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.000343Z digest=sha256:29468efc925dbf813852ae2a87249940a0555315b7f2560bac7ed52f67c823e2

Observation 4554704a-1992-437f-993f-6e83a25c1ccf · outbound

This paper cites InstructBLIP: Towards general-purpose vision-language models with instruction tuning.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge InstructBLIP: Towards general-purpose vision-language models with instruction tuning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:57.093543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:57.093543Z digest=sha256:b31ded7d3050f48813f9b5178ff7975c60ecbcc1d91717043ed17b617e7cfe53

Observation a587e94d-0051-49f0-9fe2-5f29f904ea42 · outbound

This paper cites DeepSeek-V3 Technical Report.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge DeepSeek-V3 Technical Report

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:57.187657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:57.187657Z digest=sha256:1d845aadfde128fcd6f91086c781925f82320c2855da59298d410fa307bbac92

Observation 8cd11863-fa31-430d-9e75-cd0bb50109e5 · outbound

This paper cites Not all lan- guage model features are one-dimensionally linear.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Not all lan- guage model features are one-dimensionally linear

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.685879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.263179Z digest=sha256:ba765aecdc317feba3ef20c3c06e3e720fad46177098237534f4136b5b9fa2fd

Observation d014f255-0e16-448a-a806-e21eaa130da2 · outbound

This paper cites Dissecting recall of factual associations in auto-regressive language models.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Dissecting recall of factual associations in auto-regressive language models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.670692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.331092Z digest=sha256:caa66e837de4a5aff6a6ec3f1113e79c77e855ef8e531a59c30c84164c649a09

Observation 81677c5e-c886-498b-92d1-b341063cfaa4 · outbound

This paper cites Understanding finetuning for factual knowledge extraction.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Understanding finetuning for factual knowledge extraction

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.653178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.437875Z digest=sha256:2b7d1e86108c5ec39d26e2b3844b6734388c4025c72257a87ad21bab0ccff650

Observation 6525eaa8-741a-46dd-9d05-2d331af21aa8 · outbound

This paper cites Reverse training to nurse the reversal curse.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Reverse training to nurse the reversal curse

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.636324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.525013Z digest=sha256:eea891d068351f33f17607b0191c9bdbb8c91691b0a335d17e337e6d8933f3c2

Observation 0c080acd-9d5b-4cbf-9ee5-09248da88793 · outbound

This paper cites Universal neurons in GPT2 language models.Transactions on Machine Learning Research, 2024.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Universal neurons in GPT2 language models.Transactions on Machine Learning Research, 2024

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.620553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.598713Z digest=sha256:35359954eb39cdb1ce99ee98c4834a3a598087b83653090e0fd1d6eed383e9fa

Observation b3a2cf25-4c7d-4583-9365-fe5ad4d26828 · outbound

This paper cites Finding neurons in a haystack: Case studies with sparse probing.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Finding neurons in a haystack: Case studies with sparse probing

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.603736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.673664Z digest=sha256:5206ec246c0dd772b963771710567c4b6ab9aaff79cf0fc9a35c414db3c48b77

Observation 8bc5750b-3486-45c9-867a-40dd8d54e304 · outbound

This paper cites Language models represent space and time.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Language models represent space and time

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.587439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.729883Z digest=sha256:f389917255e66d0c6860793c2905dcb08caabe057ea1d5965f58b75b06d4a18d

Observation 22c0e65d-3d6c-4eb0-816d-d556c3b90c6f · outbound

This paper cites Language models as knowledge bases: On entity rep- resentations, storage capacity, and paraphrased queries.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Language models as knowledge bases: On entity rep- resentations, storage capacity, and paraphrased queries

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.571711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.759919Z digest=sha256:a03ae554d557dadb3319049bc769d672ae6b1d428d75f2272ed7645f47f2bec2

Observation 973a03e0-521d-4407-b949-a848c30e6469 · outbound

This paper cites Monotonic representation of numeric attributes in language models.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Monotonic representation of numeric attributes in language models

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.555651Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.814650Z digest=sha256:0d93af34ac4737d34815df9c49a95bb14a7bb74dd5278c2cbd5e6f389a5421df

Observation 7e95b614-8cc0-44ea-97da-1c9198c764b0 · outbound

This paper cites Linearity of relation decoding in transformer language models.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Linearity of relation decoding in transformer language models

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.539743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.894251Z digest=sha256:291b53c1457fdf54503c041a951e1f80a269844a87eee747eeb3950dff549544

Observation 20f5776f-811d-4278-b22c-e03aa1035aa0 · outbound

This paper cites Dick, Hidenori Tanaka, Tim Rocktäschel, Edward Grefenstette, and David Krueger.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Dick, Hidenori Tanaka, Tim Rocktäschel, Edward Grefenstette, and David Krueger

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.520710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:57.982625Z digest=sha256:41b4c5e0103781bb5fc3f91158b34646f18b051c7dd06eb4ae6fc5adbe0071bc

Observation 3e72995e-9a5b-4270-9341-77e4e3c04a08 · outbound

This paper cites Instruction-tuned language models are better knowledge learners.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Instruction-tuned language models are better knowledge learners

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.502964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.082071Z digest=sha256:b4ec79a36bc101686d882cc3dbc5e0bd1a597b0af782ad6453b756596e605b85

Observation 6527b1a8-f8f4-4b71-b4c3-b756d54108a3 · outbound

This paper cites Backward lens: Projecting language model gradients into the vocabulary space.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Backward lens: Projecting language model gradients into the vocabulary space

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.486954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.152729Z digest=sha256:370607be5222e665609ab32480c973c173f9c62588aaf3066b83831bb7623207

Observation a4e94535-4f2c-4890-92bc-8106a40b3e26 · outbound

This paper cites The remarkable robustness of LLMs: Stages of inference? In ICML 2024 Workshop on Mechanistic Interpretability, 2024.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge The remarkable robustness of LLMs: Stages of inference? In ICML 2024 Workshop on Mechanistic Interpretability, 2024

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.470762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.265444Z digest=sha256:63a69650235dd99b497aeeda99db392d5114bd82380e349c0609bb97cd2061ce

Observation 5697e7b4-3679-4e45-8f6c-e3dda5db059b · outbound

This paper cites Understanding Neural Networks through Representation Erasure.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Understanding Neural Networks through Representation Erasure

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:58.343008Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:58.343008Z digest=sha256:7c706f9188461a92bf2ede9f01a000210b8c6e1b4c766bb840b77c5eff932b30

Observation f75e0658-dc31-4ad4-b295-7a3d5e5e856f · outbound

This paper cites Relation also knows: Rethinking the recall and editing of factual associations in auto-regressive transformer language models.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Relation also knows: Rethinking the recall and editing of factual associations in auto-regressive transformer language models

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.452936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.433768Z digest=sha256:16e095dd03032dcf9c8db22d9f26292b4f9f707fd14e03dc16e694d4e501efed

Observation 7608ad4a-b913-4aa0-8d5e-a3094aef8c41 · outbound

This paper cites The flan collection: Designing data and methods for effective instruction tuning.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge The flan collection: Designing data and methods for effective instruction tuning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:11:58.484298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:11:58.484298Z digest=sha256:c1cf3fdc784c6b72c49a4375951ee477682251fa930eeae80c2af7b769f4cc12

Observation d0a9076d-61a8-4aeb-82bf-3eb84095e623 · outbound

This paper cites Can neural network memorization be localized? In International Conference on Machine Learning, pages 23536–23557.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Can neural network memorization be localized? In International Conference on Machine Learning, pages 23536–23557

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.425608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.568097Z digest=sha256:e6a6c5d52af2fb3ed40f39755b72d08daf78afa0aa607021d3c74ddafbcbf94e

Observation 0f22006f-a7a4-4463-b145-45de7dda21d2 · outbound

This paper cites The geometry of truth: Emergent linear structure in large language model representations of true/false datasets.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge The geometry of truth: Emergent linear structure in large language model representations of true/false datasets

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.408933Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.657427Z digest=sha256:b2b7095676c400592f0a82c8738f379494a025d56c724c93c33e4b212d6dedd6

Observation 324e89a1-f10f-4586-9dd0-570cf88c1f6d · outbound

This paper cites Locating and editing factual associations in gpt.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Locating and editing factual associations in gpt

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.393825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.733736Z digest=sha256:ca0e663260fd3cb78443c628cbb95846168361cddcb0385411eccfdaae43d824

Observation 5a7c8702-a860-4522-b987-39873f52e014 · outbound

This paper cites What does the knowledge neuron thesis have to do with knowledge? In International Conference on Learning Representations, 2024.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge What does the knowledge neuron thesis have to do with knowledge? In International Conference on Learning Representations, 2024

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.377428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.820024Z digest=sha256:8598c235128f0d5b15d99fcf1ab7ad438b810fc7e426dd32d6cc178e411cb0a8

Observation 6678ca99-ffef-4e82-804c-8c5b97384f26 · outbound

This paper cites Interpreting gpt: the logit lens.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Interpreting gpt: the logit lens

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.361530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:58.910156Z digest=sha256:9181cdecb080168e61bb0978ebc35673c7dbd71274e65c4c897145b0eec99a26

Observation b1f5d9e1-5f8e-437e-b61a-8ff6e097dda6 · outbound

This paper cites Competition of mechanisms: Tracing how language models handle facts and coun- terfactuals.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Competition of mechanisms: Tracing how language models handle facts and coun- terfactuals

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.345678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.011556Z digest=sha256:c5177718198e63df18c278316e267703a48f7fa711361460875b8358c392fd7e

Observation 1fe10073-079a-4996-b57d-7c858aaaf69b · outbound

This paper cites Training language models to follow instructions with human feedback.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Training language models to follow instructions with human feedback

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.328998Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.110112Z digest=sha256:8fa67ba32fdbffc6d091a8afb1862a79db5542816e3a2d8c687dc2b1f73afcfe

Observation 0e1be8a5-bc2b-419d-886e-55c39f5f529b · outbound

This paper cites Task-specific skill localization in fine-tuned language models.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Task-specific skill localization in fine-tuned language models

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.312987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.164320Z digest=sha256:c9ebf93724b38e4f607a279004e61da649b30109a7aed1bd444aa872e38b8a2d

Observation 9870608e-4c31-46cd-87f6-429a3e0f26ef · outbound

This paper cites When do prompting and prefix-tuning work? a theory of capabilities and limitations.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge When do prompting and prefix-tuning work? a theory of capabilities and limitations

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.295203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.264580Z digest=sha256:a592b0afaf09ea50f2e665de45e47e0ff9eec421adb5994d1328fed6f3ba1727

Observation aabb615d-e817-4643-926d-1a14022edaf1 · outbound

This paper cites Fine-tuning enhances existing mechanisms: A case study on entity tracking.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Fine-tuning enhances existing mechanisms: A case study on entity tracking

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.277195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.300465Z digest=sha256:a048374ddb25e006ec8205d640e1ea46221095d72a3c12e375826d617bd86326

Observation e585837d-00c9-4ff6-8a29-67d978c42918 · outbound

This paper cites Neurons in large language models: Dead, n-gram, positional.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Neurons in large language models: Dead, n-gram, positional

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.261278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.456617Z digest=sha256:75bee83aad8cf7b2b8d2c01a0efd4540bc9c080ca67a76fc53a18d56e571cb32

Observation bb789b86-5448-4e13-9ad5-83fd90a7f718 · outbound

This paper cites Finding skill neurons in pre-trained transformer-based language models.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Finding skill neurons in pre-trained transformer-based language models

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.225231Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.562972Z digest=sha256:fdc72572ece4e3a9900c84c17e3d45ec73adeb875f99095d36f230747bc35d24

Observation 1ee714e2-6c90-4c38-9405-4de4a732c500 · outbound

This paper cites Super-NaturalInstructions: Generalization via declarative instructions on 1600+ NLP tasks.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Super-NaturalInstructions: Generalization via declarative instructions on 1600+ NLP tasks

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:02.088541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:11:59.843891Z digest=sha256:abf6671f8fe7f2cb53c70420c88baaadd5073ff2a56c4def75fa70574618eed3

Observation af953b96-c6e4-4fb9-a0a5-38bd1f900ba8 · outbound

This paper cites Qwen2.5 Technical Report.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Qwen2.5 Technical Report

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:12:00.106658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:12:00.106658Z digest=sha256:cbf1c75bd569d8a59243679d810670579f39a42fd603d34ed607e90ef77f9043

Observation 90f0e5b7-c7bd-460d-8905-ab3020ec4f4a · outbound

This paper cites Knowledge circuits in pretrained transformers.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Knowledge circuits in pretrained transformers

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:01.921457Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:12:00.225100Z digest=sha256:6439e7dd9134f1a2356e0ff096c51b7ed0951203086e0f27adea9864379e1a08

Observation e6d827a9-bbaa-47a2-beb1-ddb678f13b58 · outbound

This paper cites Towards best practices of activation patching in language models: Metrics and methods.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge Towards best practices of activation patching in language models: Metrics and methods

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:01.782256Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:12:00.343718Z digest=sha256:067b4fbc295229bf2dcbe79b34c438ccb08155b4a6ad616870fd6fbaafcbeb43

Observation c32fb028-0170-4ef5-94c5-4b4add4ab808 · outbound

This paper cites How do large language models handle multilingualism? In Advances in Neural Information Processing Systems, 2024.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge How do large language models handle multilingualism? In Advances in Neural Information Processing Systems, 2024

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:01.686449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:12:00.357834Z digest=sha256:0bd65b552423f9cee4111c226f0fedf89902d263a1ff7c7a7fb8ceab926b0169

Observation 5612ee6c-37a7-423d-a832-82276e6275da · outbound

This paper cites (b) Overlapping Ratio vs.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge (b) Overlapping Ratio vs

Reference 52

Resolution
malformed identifier
raw_fallback, observed 2026-08-07T15:12:00.838220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:12:00.428467Z digest=sha256:c482e320490d0282c24057f19c3434f4c6875606e5314444546a2151ffc673a0

Observation d2c135a1-8043-40b7-baa0-4589f0f8e668 · outbound

This paper cites He benefited from the world-class education and research facilities at Andrew Jackson University.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge He benefited from the world-class education and research facilities at Andrew Jackson University

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:01.182317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:12:00.573379Z digest=sha256:aecc9f9e1922a3681c9d40b73c7c0aff2ba7a68af0b9b1bca01370b5c1809104

Observation f8f2214e-c568-46ed-bedc-a491e28c43e7 · outbound

This paper cites He benefited from the world-class education and research facilities at Andrew Jackson University.

Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge He benefited from the world-class education and research facilities at Andrew Jackson University

Reference 1982

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:12:01.362715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:12:00.484257Z digest=sha256:898df7d432fea4be80bd72d6a846bd3a1bc025ce3a98e49147dbee0a4b8348c9

Pith citing papers

Observation aa3b18c5-23ec-47e6-9973-0621f72de720 · inbound

Reverse Convolution and Its Applications to Image Restoration cites this paper.

Reverse Convolution and Its Applications to Image Restoration Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T20:53:40.719452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T20:53:40.719452Z digest=sha256:84ff1dde195f902b7914c22e87f98e521d48e33e0278870930c27f2efb47f23d

Observation 05210f89-4f2d-46d8-bc3a-8c44449424cb · inbound

Deep sequence models tend to memorize geometrically; it is unclear why cites this paper.

Deep sequence models tend to memorize geometrically; it is unclear why Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge

Reference 202

Resolution
verified exact
arxiv_id, observed 2026-05-29T02:04:53.815446Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-21T20:38:18.005002Z digest=sha256:6025c664ef361e48fefead4f080190c6b30011bbd737631889fec3581874ccea

Observation 3034ac67-e9b9-42a3-b4a9-feed42715713 · inbound

LMs as Task-Specific Knowledge Bases: An Interpretability Analysis cites this paper.

LMs as Task-Specific Knowledge Bases: An Interpretability Analysis Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge

Reference 71

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T14:19:53.914287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-26T04:15:31.054780Z digest=sha256:be2b2c6c3a211952029e82af5e667bc9ff78b659b862ca18ec840beb961e99ac