{"as_of":"2026-08-09T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec23f03f26e88e73e6b70ac3c46bb51725f67397c1274da792e4dcf0fab8c192","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:12:00.573379Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:53:40.719452Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T14:19:53.912897Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16178","snapshot_observed_at":"2026-08-05T20:53:40.719452Z","title":"up-word-down-label","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09824","last_updated":"2025-08-15T01:40:46Z","snapshot_observed_at":"2026-08-05T20:53:05.616467Z","submitted_at":"2025-08-13T13:56:01Z","title":"Reverse Convolution and Its Applications to Image Restoration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:53:40.719452Z"},"links":{"cited_paper":"/paper/2505.16178","citing_paper":"/paper/2508.09824"},"observation_digest":"sha256:84ff1dde195f902b7914c22e87f98e521d48e33e0278870930c27f2efb47f23d","observation_id":"aa3b18c5-23ec-47e6-9973-0621f72de720","resolution":{"observed_at":"2026-08-05T20:53:40.719452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"cited_work":{"arxiv_id":"2505.16178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16178","snapshot_observed_at":"2026-07-04T14:19:53.912897Z","title":"Understanding fact recall in language models: Why two-stage training encourages memorization but mixed training teaches knowledge","venue":"cs.CL","work_id":"e5f336ec-4763-4dc4-84a2-72f3100f1755","year":2025},"citing_paper":{"arxiv_id":"2510.26745","last_updated":"2026-05-18T17:56:38Z","snapshot_observed_at":"2026-08-02T20:19:54.425869Z","submitted_at":"2025-10-30T17:40:22Z","title":"Deep sequence models tend to memorize geometrically; it is unclear why","version":3},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-05-21T20:38:18.005002Z"},"links":{"cited_paper":"/paper/2505.16178","citing_paper":"/paper/2510.26745"},"observation_digest":"sha256:d257bf397e5c481299dbfc025ae44b960d0acb91cba5b4c9c4d575b32832aacb","observation_id":"05210f89-4f2d-46d8-bc3a-8c44449424cb","resolution":{"observed_at":"2026-05-29T02:04:53.815446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"cited_work":{"arxiv_id":"2505.16178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16178","snapshot_observed_at":"2026-07-04T14:19:53.912897Z","title":"Understanding fact recall in language models: Why two-stage training encourages memorization but mixed training teaches knowledge","venue":"cs.CL","work_id":"e5f336ec-4763-4dc4-84a2-72f3100f1755","year":2025},"citing_paper":{"arxiv_id":"2606.27237","last_updated":"2026-08-06T12:36:42Z","snapshot_observed_at":"2026-08-09T08:12:45.187203Z","submitted_at":"2026-06-25T16:22:43Z","title":"LMs as Task-Specific Knowledge Bases: An Interpretability Analysis","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-26T04:15:31.054780Z"},"links":{"cited_paper":"/paper/2505.16178","citing_paper":"/paper/2606.27237"},"observation_digest":"sha256:8f65d3abc3f66365bff770577f23d52d8db91904e413768d21e9e896abd8ad0d","observation_id":"3034ac67-e9b9-42a3-b4a9-feed42715713","resolution":{"observed_at":"2026-07-04T14:19:53.914287Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16178/citation-record","integrity":"/paper/2505.16178/integrity","json":"/paper/2505.16178/citation-record.json","paper":"/paper/2505.16178"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.904197Z","title":"Evaluating correctness and faithfulness of instruction-following models for question answering","venue":null,"work_id":"7a97044c-3d6e-4041-904c-9da42a5c0c14","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.400714Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:8f18b7de80b74a75cc3862eccf3c5bd109851d2eb9d3a9ad9deb6b30798e5459","observation_id":"b3b0063e-b53a-4442-9ee6-3de35ee46ad9","resolution":{"observed_at":"2026-08-07T15:12:02.909216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:55.475764Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.475764Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:977aba01b3912c829e44a3991061e11c3d5d0acf1884ebc1dec18077ef69fb74","observation_id":"9cc26fe9-fad4-4789-b343-d91b52fa66f7","resolution":{"observed_at":"2026-08-07T15:11:55.475764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.875374Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction","venue":null,"work_id":"1fd52df9-8ef6-4e71-ac94-68c4db0ede3f","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.592211Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:ede669832bd77c813ea8eede2cb6013cb2c064607feb28e8d414efe1f34db3af","observation_id":"e41ee26d-26d9-4ee4-a093-efb3b83ee40f","resolution":{"observed_at":"2026-08-07T15:12:02.881252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.859951Z","title":"Physics of language models: Part 3.2, knowledge manipula- tion","venue":null,"work_id":"89d09260-c568-487c-bdc0-c3dcfbfaa90d","year":2025},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.743068Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:20c0aae0494d549ababe8d871c64f915bf9312dcea20b64de6c0aac86739da2b","observation_id":"13869605-8315-40d7-b021-776c72b2b662","resolution":{"observed_at":"2026-08-07T15:12:02.865284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.844494Z","title":"Towards better understanding of gradient-based attribution methods for deep neural networks","venue":null,"work_id":"c10dcc02-6f93-43a8-ad5f-50b805126ce4","year":2018},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.839999Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:c3bbb3f108ba51fa94b07af342350bef377fe144c9e39df8a3234056894dead0","observation_id":"59b507d6-e94e-4515-be59-e36ee589cdf8","resolution":{"observed_at":"2026-08-07T15:12:02.849487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:11:55.947350Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.947350Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:a159d370413a2f9a9ab97a1987eb3db5f16e42e2b7bc3a35c304de934055cf3f","observation_id":"bb00f3c9-52e9-4000-9e30-a8303963cfb8","resolution":{"observed_at":"2026-08-07T15:11:55.947350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.828173Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"a9b5ac2c-7063-4ea0-89be-c1b9626dbd48","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.060845Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:fd2696c2314be37d1d245195b5894e46815246c44f34f02dcda14b6779e251ae","observation_id":"2d020124-f740-4d2c-9053-8bb795e7911c","resolution":{"observed_at":"2026-08-07T15:12:02.833474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.812096Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"c9ffc339-c600-407c-aa6e-7b2caec1c006","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.209417Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:3c900c5894a4f1be2ee9328a0124960364c8fd5cb338119af002925be74024ea","observation_id":"195992c6-268c-442d-8397-2f86538a3eff","resolution":{"observed_at":"2026-08-07T15:12:02.817716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:56.397434Z","title":"Causal scrubbing: A method for rigorously testing interpretability hypotheses","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.397434Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:b70cdda63a2de2964c57a3d952a1b8948df056816343e58269a8d343d9a84342","observation_id":"2360e71c-2c40-47e3-ae0a-0bc67a629fff","resolution":{"observed_at":"2026-08-07T15:11:56.397434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.784163Z","title":"Journey to the center of the knowledge neurons: Discoveries of language-independent knowledge neurons and degenerate knowledge neurons","venue":null,"work_id":"7d976344-1698-4d8f-ac04-cbbb929163c8","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.530960Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:38840150e73735af8a0f788394ce5368e0459e95fa1b1a58aa04ce899a825fa8","observation_id":"6a5d02bf-22bf-4698-b299-fe3e35741a63","resolution":{"observed_at":"2026-08-07T15:12:02.790929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.766719Z","title":"Instruc- tion pre-training: Language models are supervised multitask learners","venue":null,"work_id":"b7791f0e-8b8b-4045-9488-90d875c8aea8","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.613248Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:244549f23d4ed34041222eeededb31c52fc5afc7e870d5bd645c9a2b2babf317","observation_id":"8d2b9e9e-e811-48bf-9e9b-738bea0e7407","resolution":{"observed_at":"2026-08-07T15:12:02.772342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.750481Z","title":"Zhao, Yanping Huang, Andrew M","venue":null,"work_id":"e1483bda-4a19-46b2-8e8f-a3bb4efa6358","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.734483Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:2028a8e1d8d86f6a4b5a4b6254f23ea0d45ac7ad8dcb10412fdcdee2dcd81453","observation_id":"4c73c785-e1a6-4ccb-a084-1ae57e33ea00","resolution":{"observed_at":"2026-08-07T15:12:02.756083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.734199Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":"f3165107-caa7-4a86-b82b-b46f81c3e90f","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.810407Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:d51ea4082aeffaed5b41d0cac4f30d3cf4c32eb2789a756e85b2e594616dcc7e","observation_id":"dd64acd9-f7d6-45cb-aa59-4472c17c6751","resolution":{"observed_at":"2026-08-07T15:12:02.740201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:56.908529Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.908529Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:2912f9fd2ef89f3c29fd33829fe71ab3e711ca3a90d4085f08dc9c768aa9a896","observation_id":"7b27cf0d-cc75-4629-9085-66d95b2803c0","resolution":{"observed_at":"2026-08-07T15:11:56.908529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.706724Z","title":"Knowledge neurons in pretrained transformers","venue":null,"work_id":"9197efaa-4728-4f1e-b049-ea59657009cd","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.000343Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:9a91c82a3216e6bdcd086ac2df3bb6abaa619e6a1e1db06db9eb20e8faa6841e","observation_id":"9897528a-d134-4077-9dbb-06064f5b0d74","resolution":{"observed_at":"2026-08-07T15:12:02.712936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:57.093543Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.093543Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:b31ded7d3050f48813f9b5178ff7975c60ecbcc1d91717043ed17b617e7cfe53","observation_id":"4554704a-1992-437f-993f-6e83a25c1ccf","resolution":{"observed_at":"2026-08-07T15:11:57.093543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:11:57.187657Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.187657Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:1d845aadfde128fcd6f91086c781925f82320c2855da59298d410fa307bbac92","observation_id":"a587e94d-0051-49f0-9fe2-5f29f904ea42","resolution":{"observed_at":"2026-08-07T15:11:57.187657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.680551Z","title":"Not all lan- guage model features are one-dimensionally linear","venue":null,"work_id":"694ad2d6-916e-43dd-94e8-0edc8f36d8ea","year":2025},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.263179Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:8c740faadcb018269a59914eac8846e9338d4838dd9e19dd7b53d239d2911e65","observation_id":"8cd11863-fa31-430d-9e75-cd0bb50109e5","resolution":{"observed_at":"2026-08-07T15:12:02.685879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.664920Z","title":"Dissecting recall of factual associations in auto-regressive language models","venue":null,"work_id":"84a6ab66-7871-4bef-9104-9124951ce457","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.331092Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:68071185209a63781d1562d49bd951f3e92c1d267e5d2f6e37c32240d7d0b004","observation_id":"d014f255-0e16-448a-a806-e21eaa130da2","resolution":{"observed_at":"2026-08-07T15:12:02.670692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.646848Z","title":"Understanding finetuning for factual knowledge extraction","venue":null,"work_id":"cc3b7f95-0a27-4dba-bba3-5f744337ee35","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.437875Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:6bda5fd79ff17959f22e60b9b5352804d2078aaf42f847589e68195ada90b425","observation_id":"81677c5e-c886-498b-92d1-b341063cfaa4","resolution":{"observed_at":"2026-08-07T15:12:02.653178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.631595Z","title":"Reverse training to nurse the reversal curse","venue":null,"work_id":"2be6df7d-09d6-4a3f-8bd9-7de1b2163394","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.525013Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:5c50cd48eea5e090e4ffe7fd08e0d7288781a975ca0c1286328b2a806e538f32","observation_id":"6525eaa8-741a-46dd-9d05-2d331af21aa8","resolution":{"observed_at":"2026-08-07T15:12:02.636324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.615728Z","title":"Universal neurons in GPT2 language models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"4ca3c26d-1b76-48e8-867f-cf4b6d9dfa6b","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.598713Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:eb51c17339184b3674cb2eb74b4eae10d200e3e8f15f093bbb28984db8f7bcfd","observation_id":"0c080acd-9d5b-4cbf-9ee5-09248da88793","resolution":{"observed_at":"2026-08-07T15:12:02.620553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.597719Z","title":"Finding neurons in a haystack: Case studies with sparse probing","venue":null,"work_id":"38b4c36d-3868-404b-9c98-5706d44fd44a","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.673664Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:4f855887b342f9252f9a9ce859d32b7cf9f095a893a77569644180f7d9a63a0f","observation_id":"b3a2cf25-4c7d-4583-9365-fe5ad4d26828","resolution":{"observed_at":"2026-08-07T15:12:02.603736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.582224Z","title":"Language models represent space and time","venue":null,"work_id":"8eab78ca-9e64-4994-8d59-282e4b87bac3","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.729883Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:a526d406e9fa2558aca6c324972ac643e2ad084fd6ad544572ae94b737dbb735","observation_id":"8bc5750b-3486-45c9-867a-40dd8d54e304","resolution":{"observed_at":"2026-08-07T15:12:02.587439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.566806Z","title":"Language models as knowledge bases: On entity rep- resentations, storage capacity, and paraphrased queries","venue":null,"work_id":"3de1f148-778c-4c72-8213-35d2063ff011","year":2021},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.759919Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:400385be39498df66fbe033928e2fcc55290445246832766bac8a0e537ceb9e8","observation_id":"22c0e65d-3d6c-4eb0-816d-d556c3b90c6f","resolution":{"observed_at":"2026-08-07T15:12:02.571711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.550334Z","title":"Monotonic representation of numeric attributes in language models","venue":null,"work_id":"1d57e31b-e7a4-45e8-8e6c-fae827b91e40","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.814650Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:611d723c4ccc2cd13003a5a8b260c807dd93fdd7dedf49e7dcc4481ebe0e70de","observation_id":"973a03e0-521d-4407-b949-a848c30e6469","resolution":{"observed_at":"2026-08-07T15:12:02.555651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.533137Z","title":"Linearity of relation decoding in transformer language models","venue":null,"work_id":"737b8629-3bb2-4250-8c53-3511c0ceb7b6","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.894251Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:c269079c91a5da463534323dd2ce53ac2495657f914f083ff921a16c0bc5dc2b","observation_id":"7e95b614-8cc0-44ea-97da-1c9198c764b0","resolution":{"observed_at":"2026-08-07T15:12:02.539743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.515016Z","title":"Dick, Hidenori Tanaka, Tim Rocktäschel, Edward Grefenstette, and David Krueger","venue":null,"work_id":"81094d39-d1ea-463b-abb7-a28f0c0ba8fa","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.982625Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:fce80454248254423292735d3b4f5874097a2f3770d56f0a2fbb6ff8db2f1828","observation_id":"20f5776f-811d-4278-b22c-e03aa1035aa0","resolution":{"observed_at":"2026-08-07T15:12:02.520710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.497358Z","title":"Instruction-tuned language models are better knowledge learners","venue":null,"work_id":"4917bcc9-edeb-4d97-8849-afa661e7924b","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.082071Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:75fd983bd596f6e13db5264ecf1a39aacd6134d2944fbd1d5f3d2f9f503375d1","observation_id":"3e72995e-9a5b-4270-9341-77e4e3c04a08","resolution":{"observed_at":"2026-08-07T15:12:02.502964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.481928Z","title":"Backward lens: Projecting language model gradients into the vocabulary space","venue":null,"work_id":"d31a7155-42eb-4afd-b5e9-9a8fbb11937f","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.152729Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:d3fed7c54e5f87afff5fb7e04aeabda890be5e9bfca9f00e5caefe4c7159073c","observation_id":"6527b1a8-f8f4-4b71-b4c3-b756d54108a3","resolution":{"observed_at":"2026-08-07T15:12:02.486954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.465299Z","title":"The remarkable robustness of LLMs: Stages of inference? In ICML 2024 Workshop on Mechanistic Interpretability, 2024","venue":null,"work_id":"3ce40e59-c57b-48b8-b35d-4fa7ad4e7391","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.265444Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:f06bbc3b8861e2cbdad0875386b946b9debcdf4533bd6c43486745752a4a49a5","observation_id":"a4e94535-4f2c-4890-92bc-8106a40b3e26","resolution":{"observed_at":"2026-08-07T15:12:02.470762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.08220","last_updated":"2017-01-10T01:40:51Z","snapshot_observed_at":"2026-08-08T03:37:05.499811Z","submitted_at":"2016-12-24T21:36:07Z","title":"Understanding Neural Networks through Representation Erasure","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.08220","snapshot_observed_at":"2026-08-07T15:11:58.343008Z","title":"Understanding neural networks through representation erasure","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.343008Z"},"links":{"cited_paper":"/paper/1612.08220","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:7c706f9188461a92bf2ede9f01a000210b8c6e1b4c766bb840b77c5eff932b30","observation_id":"5697e7b4-3679-4e45-8f6c-e3dda5db059b","resolution":{"observed_at":"2026-08-07T15:11:58.343008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.447045Z","title":"Relation also knows: Rethinking the recall and editing of factual associations in auto-regressive transformer language models","venue":null,"work_id":"febf1595-c450-45ee-8ba7-30517de3d3d3","year":2025},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.433768Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:b2707f1a2235a77ac2c1229b30011f9fddc2e941e2acc26612dc85a350462133","observation_id":"f75e0658-dc31-4ad4-b295-7a3d5e5e856f","resolution":{"observed_at":"2026-08-07T15:12:02.452936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:58.484298Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.484298Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:c1cf3fdc784c6b72c49a4375951ee477682251fa930eeae80c2af7b769f4cc12","observation_id":"7608ad4a-b913-4aa0-8d5e-a3094aef8c41","resolution":{"observed_at":"2026-08-07T15:11:58.484298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.419485Z","title":"Can neural network memorization be localized? In International Conference on Machine Learning, pages 23536–23557","venue":null,"work_id":"4c1e7617-5480-4404-b45f-1e1d87d09140","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.568097Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:8e955389688db8bbafbb2219412c910055957fd0a27b60246662005b9496721c","observation_id":"d0a9076d-61a8-4aeb-82bf-3eb84095e623","resolution":{"observed_at":"2026-08-07T15:12:02.425608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.404208Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":"285d61ae-dfa1-4b1a-9140-c82141cd7d31","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.657427Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:1e54c6c0fe579694bf428534eabfc438c8d0fa66bc67cee4deff2274ac23d525","observation_id":"0f22006f-a7a4-4463-b145-45de7dda21d2","resolution":{"observed_at":"2026-08-07T15:12:02.408933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.388519Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"121aadc7-44ad-40e1-9543-40eac1f3a5ff","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.733736Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:7dfe85d08508119e398c2a4d2a1fd77bbe36933894c7c2f6f0c27cfdfff79a71","observation_id":"324e89a1-f10f-4586-9dd0-570cf88c1f6d","resolution":{"observed_at":"2026-08-07T15:12:02.393825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.371864Z","title":"What does the knowledge neuron thesis have to do with knowledge? In International Conference on Learning Representations, 2024","venue":null,"work_id":"4253fa01-734b-47a7-b4da-31c85ef7a1a7","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.820024Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:9460896c017934a5c70aef76a9928d152ee11fb5bf68c3279ccb30bceb561a77","observation_id":"5a7c8702-a860-4522-b987-39873f52e014","resolution":{"observed_at":"2026-08-07T15:12:02.377428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.356476Z","title":"Interpreting gpt: the logit lens","venue":null,"work_id":"831b41bf-de5a-4840-91d6-dd69408a2b74","year":2020},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.910156Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:934e645d19e79d2d8782383becfd26bfce3df70e02af94b7180cd3997e7cb394","observation_id":"6678ca99-ffef-4e82-804c-8c5b97384f26","resolution":{"observed_at":"2026-08-07T15:12:02.361530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.339805Z","title":"Competition of mechanisms: Tracing how language models handle facts and coun- terfactuals","venue":null,"work_id":"dca003db-f1a3-42cc-94ab-e8ec19a4f3b3","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.011556Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:6d6794356cb78f428796e1fb840346d3b191db46c76721b49ef0377e20090b04","observation_id":"b1f5d9e1-5f8e-437e-b61a-8ff6e097dda6","resolution":{"observed_at":"2026-08-07T15:12:02.345678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.323461Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"6a87535b-efca-404d-a73b-328c43592b9a","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.110112Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:5519bef2d091bde66a2e74a95149ce6b73263b6e2732f0194a06140ebc075e6f","observation_id":"1fe10073-079a-4996-b57d-7c858aaaf69b","resolution":{"observed_at":"2026-08-07T15:12:02.328998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.307443Z","title":"Task-specific skill localization in fine-tuned language models","venue":null,"work_id":"043b6f7c-5b65-4d30-af48-f92dd47d28fc","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.164320Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:7b3bf4a0514b4a433693b0baad7af6789ea2c20ca0cc29f6b796883045b6c370","observation_id":"0e1be8a5-bc2b-419d-886e-55c39f5f529b","resolution":{"observed_at":"2026-08-07T15:12:02.312987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.288607Z","title":"When do prompting and prefix-tuning work? a theory of capabilities and limitations","venue":null,"work_id":"1e0bfd3b-5a2f-4ac7-8b3c-eaba34ab48c2","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.264580Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:c2a07ee2181d306e9a24b130bfd9e5f00cc496271b02fd95f825cef4656ce5dc","observation_id":"9870608e-4c31-46cd-87f6-429a3e0f26ef","resolution":{"observed_at":"2026-08-07T15:12:02.295203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.271600Z","title":"Fine-tuning enhances existing mechanisms: A case study on entity tracking","venue":null,"work_id":"1a2634ce-d5af-457e-bbc9-5593b27e8605","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.300465Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:eea34fc2059c209498592287dabdb1b983410e9ec9a0d1b0e9f7ebf63588f03d","observation_id":"aabb615d-e817-4643-926d-1a14022edaf1","resolution":{"observed_at":"2026-08-07T15:12:02.277195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.255575Z","title":"Neurons in large language models: Dead, n-gram, positional","venue":null,"work_id":"e030e440-eb9b-4da2-8b4a-6860c4206b99","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.456617Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:bd79c66e91cfe95907075171a25f8c0df0ad26ca13c9fec3f0f18007d37001cd","observation_id":"e585837d-00c9-4ff6-8a29-67d978c42918","resolution":{"observed_at":"2026-08-07T15:12:02.261278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.164287Z","title":"Finding skill neurons in pre-trained transformer-based language models","venue":null,"work_id":"825c574b-e7a8-49b3-852b-aaf3dacb4959","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.562972Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:11d048651b0d06b28ed6ab4c915835e152b3f6c74cba785a1cfc1d751b20b712","observation_id":"bb789b86-5448-4e13-9ad5-83fd90a7f718","resolution":{"observed_at":"2026-08-07T15:12:02.225231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.009683Z","title":"Super-NaturalInstructions: Generalization via declarative instructions on 1600+ NLP tasks","venue":null,"work_id":"da386b80-bac0-4b66-81c1-92affe92bfc5","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.843891Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:7e0589c8c8c4167e65f5d6de920dd336c6ece894f29c8374df5512b9457781c8","observation_id":"1ee714e2-6c90-4c38-9405-4de4a732c500","resolution":{"observed_at":"2026-08-07T15:12:02.088541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:12:00.106658Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.106658Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:cbf1c75bd569d8a59243679d810670579f39a42fd603d34ed607e90ef77f9043","observation_id":"af953b96-c6e4-4fb9-a0a5-38bd1f900ba8","resolution":{"observed_at":"2026-08-07T15:12:00.106658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.849096Z","title":"Knowledge circuits in pretrained transformers","venue":null,"work_id":"97f6785f-f1d1-4788-bf25-68a489bde6e9","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.225100Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:3df4fef55c5202c9879006981a48e9f159e6af81130b7d89cbb271e184809dad","observation_id":"90f0e5b7-c7bd-460d-8905-ab3020ec4f4a","resolution":{"observed_at":"2026-08-07T15:12:01.921457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.724950Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":"adf0a247-38d4-4599-949d-7e5dd204cfad","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.343718Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:f2272883b12d90b8484e8016a43143c8e84371a14df08db72a31c8b199cd76fd","observation_id":"e6d827a9-bbaa-47a2-beb1-ddb678f13b58","resolution":{"observed_at":"2026-08-07T15:12:01.782256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.547544Z","title":"How do large language models handle multilingualism? In Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":"0a005f2a-305b-4046-80a5-211716829b08","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.357834Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:348bb8f3d412c5d6d8b49874cd0edc9e55ea37d4d2b9d8109bbf412367a53459","observation_id":"c32fb028-0170-4ef5-94c5-4b4add4ab808","resolution":{"observed_at":"2026-08-07T15:12:01.686449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3100.0098","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:00.776354Z","title":"(b) Overlapping Ratio vs","venue":null,"work_id":"98d748cf-107e-49ca-94b1-1e6dc5963658","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.428467Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:0953a3bcc3c0e988deac1263b56508dc6443d002497e107e36728a79b72abcb2","observation_id":"5612ee6c-37a7-423d-a832-82276e6275da","resolution":{"observed_at":"2026-08-07T15:12:00.838220Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:00.978496Z","title":"He benefited from the world-class education and research facilities at Andrew Jackson University","venue":null,"work_id":"f82c6b4b-d6c8-4b7f-8405-4ad3d3bfdd0c","year":null},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.573379Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:3661d06d421fecc368e48d4ba0986a0c9e77013e027a783c3037659f56c493c9","observation_id":"d2c135a1-8043-40b7-baa0-4589f0f8e668","resolution":{"observed_at":"2026-08-07T15:12:01.182317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.292542Z","title":"He benefited from the world-class education and research facilities at Andrew Jackson University","venue":null,"work_id":"5541fd05-4e37-4d4e-b6b3-6bd9b1f9023d","year":null},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":1982,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.484257Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:0a1289a358b4a766924166d5417ef05dd725ede612d16b08f62129e7cfa5508b","observation_id":"f8f2214e-c568-46ed-bedc-a491e28c43e7","resolution":{"observed_at":"2026-08-07T15:12:01.362715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:03:47.564318Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2505.16178."}