{"as_of":"2026-08-16T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f70b4120b94fd52bcc26807da1705c4ed42f7cbaa35320c21f1da1c892ccf3d2","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:37:36.423808Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:52:44.489356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T11:06:17.562742Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":"2504.12459","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tomas Mikolov, Wen-tau Yih, and Geoffrey Zweig","venue":null,"work_id":"e65f7b68-4d11-4131-af13-dee69dfd45b3","year":null},"citing_paper":{"arxiv_id":"2510.01685","last_updated":"2026-05-08T16:56:36Z","snapshot_observed_at":"2026-08-15T05:20:42.458681Z","submitted_at":"2025-10-02T05:21:34Z","title":"How Do Language Models Compose Functions?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T11:04:09.179536Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2510.01685"},"observation_digest":"sha256:e199e9ff34d1349bcbd4d6484a7f52208e278b12fe37be970dc8a7a74d37147d","observation_id":"eb9371a3-71e5-430c-a26b-c3960bc65be3","resolution":{"observed_at":"2026-05-18T11:06:17.566205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":"2504.12459","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tomas Mikolov, Wen-tau Yih, and Geoffrey Zweig","venue":null,"work_id":"e65f7b68-4d11-4131-af13-dee69dfd45b3","year":null},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-08-11T04:19:07.969715Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:9cb5979103c3f30867454734ada99139058d92dd91640263874766777baab9dc","observation_id":"b4298fba-acae-4c14-886a-9dc5eb2345b5","resolution":{"observed_at":"2026-05-13T05:27:19.242265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-08-02T04:52:44.489356Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13568","last_updated":"2026-07-15T08:06:59Z","snapshot_observed_at":"2026-08-14T11:04:34.183607Z","submitted_at":"2026-07-15T08:06:59Z","title":"Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T04:52:44.489356Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2607.13568"},"observation_digest":"sha256:2c943517cc6cf4490f37c3c445d5c557766e10e865519f43686046309ff9be9c","observation_id":"72086d85-fd50-4d02-ae8f-6cd0aac35639","resolution":{"observed_at":"2026-08-02T04:52:44.489356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-08-01T03:02:05.090555Z","title":"and Wiegreffe, Sarah and Elazar, Yanai , month = apr, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:05.090555Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:a81b4f1fad9746be7668c6b80b3db35c41d31c824c92921b93d87765c4547bd5","observation_id":"e530c710-5451-478f-b005-66aa643c563f","resolution":{"observed_at":"2026-08-01T03:02:05.090555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12459/citation-record","integrity":"/paper/2504.12459/integrity","json":"/paper/2504.12459/citation-record.json","paper":"/paper/2504.12459"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.113021Z","title":"To code or not to code? exploring impact of code in pre-training","venue":null,"work_id":"61d0bc96-df83-4483-871d-ef6a26048ff7","year":2025},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.219091Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:ca0eac95cbf39a09c8fb35cc023b5b5388acf4cf5ce2e3cc0d91da42d3c93a28","observation_id":"9be8aa00-ec8e-4c84-a732-a1276b6a6208","resolution":{"observed_at":"2026-08-16T12:37:37.117127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.222599Z","title":"Hacking smart machines with smarter ones: How to extract meaningful data from machine learning classifiers","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.222599Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:aac67bb9b5ef61b829f1363add942eabd94574fdf66fdc8b5eca9f59d352259f","observation_id":"02a38762-7b87-431e-b172-30f41c838d6e","resolution":{"observed_at":"2026-08-16T12:37:36.222599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12312","last_updated":"2022-11-22T15:03:48Z","snapshot_observed_at":"2026-08-16T16:14:10.448283Z","submitted_at":"2022-11-22T15:03:48Z","title":"Interpreting Neural Networks through the Polytope Lens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12312","snapshot_observed_at":"2026-08-16T12:37:36.225333Z","title":"Interpreting neural networks through the polytope lens, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.225333Z"},"links":{"cited_paper":"/paper/2211.12312","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:b51e7091b61ee2ba7d911b35cf048eb62e0b13a2081a0937639c79f8eb5e3e87","observation_id":"724aa831-5196-4c4f-aeb0-9e158903b4bb","resolution":{"observed_at":"2026-08-16T12:37:36.225333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/9833649","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.728948Z","title":"Membership inference attacks from first principles","venue":null,"work_id":"bfd57aaa-fe61-4d5a-8561-307dce6509b4","year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.229182Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:bf58dabea066a819b823c4a2ee3ab87d144b49b77b7ac1b2209f5e9f3430d37e","observation_id":"65ade467-bb03-444d-a049-8e60da7558cc","resolution":{"observed_at":"2026-08-16T12:37:36.734597Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.232547Z","title":"Quantifying memorization across neural language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.232547Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:37348a620b1d507072846531510d6c8f5dc704e065fb4bd811d2d97f3a4d252d","observation_id":"690dd01c-c5c6-44ff-bf86-1a0bb0f9daa4","resolution":{"observed_at":"2026-08-16T12:37:36.232547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.093251Z","title":"How do large language models acquire factual knowledge during pretraining? In The Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":"09f7bce2-bcf5-4eba-a519-90784decb359","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.235649Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:25c7c17d36c48744f4573901f781bfcd1e7709bb1dd7ada17028e28f610dea50","observation_id":"abe70b6b-8a87-4ac0-9423-9ec506a8e51b","resolution":{"observed_at":"2026-08-16T12:37:37.098171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.239229Z","title":"Identifying Linear Relational Concepts in Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.239229Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:31ecad40c8e5260150a4f271c266494ec11ff4daa362c16e6d30fbe38d49788f","observation_id":"82581bb6-349b-49d6-9b5a-b1a531e61b08","resolution":{"observed_at":"2026-08-16T12:37:36.239229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.bl","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.567867Z","title":"Recurrent neural networks learn to store and generate sequences using non-linear representations","venue":null,"work_id":"7d88914f-9952-43c7-b3b2-2975237a9627","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.242809Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:fad09c53ce0522a7e589494c598ad6d858760abb6e67b564b2ad16bba071128b","observation_id":"5d208efe-cb70-4887-a0ca-c1b5a09a3ad8","resolution":{"observed_at":"2026-08-16T12:37:36.572317Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.245789Z","title":"Amnesic Probing: Behavioral Explanation with Amnesic Counterfactuals","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.245789Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:92f0ebeda87b99bff3e377583f70b95cb89776b3424b3b3209ebe3ce97ade997","observation_id":"296226ad-19b5-4b10-944c-4f34e5d2946c","resolution":{"observed_at":"2026-08-16T12:37:36.245789Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14251","last_updated":"2023-03-24T07:18:59Z","snapshot_observed_at":"2026-08-16T16:42:38.277973Z","submitted_at":"2022-07-28T17:36:24Z","title":"Measuring Causal Effects of Data Statistics on Language Model's `Factual' Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14251","snapshot_observed_at":"2026-08-16T12:37:36.248759Z","title":"Measuring causal effects of data statistics on language model's `factual' predictions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.248759Z"},"links":{"cited_paper":"/paper/2207.14251","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:ab3211b758fcf3fb8097c2c9261ea2c2159cef4807fe0daa6cd1ae6ead30dbcb","observation_id":"c29e93ab-2b3d-42e3-9d62-b4b8eb55e9a7","resolution":{"observed_at":"2026-08-16T12:37:36.248759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.081455Z","title":"Smith, and Jesse Dodge","venue":null,"work_id":"d62b7ca7-c2d4-4354-80dd-9d438e19852a","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.251685Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:46e3b178422de18693c7360975d2a2187ce80b24af5c7ded7f5206421a398426","observation_id":"dff16e97-9766-4084-9ddf-47eae3b4dde7","resolution":{"observed_at":"2026-08-16T12:37:37.085232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.255407Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.255407Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2530bb6ec97b4cc9bba4d8ae50a6f9f5bf9762e7d03aa1ac14195895f1f091be","observation_id":"2128fed1-42a8-4911-864c-38476d366370","resolution":{"observed_at":"2026-08-16T12:37:36.255407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.063004Z","title":"T - RE x: A large scale alignment of natural language with knowledge base triples","venue":null,"work_id":"96882c00-063a-4dbc-bf5e-df84d80c9f4b","year":2018},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.258400Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:e8fa87401dd481d1f1240606661de82dd54630922dae0d9d3621fbec9e6c0dc5","observation_id":"f9573e36-13d2-474b-9126-440c4b4dfe71","resolution":{"observed_at":"2026-08-16T12:37:37.067881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.261244Z","title":"Towards Understanding Linear Word Analogies","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.261244Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:86ccbf8ef3eb8ff19765316afafeee8a01854eb9eed042145cf195d5dd324be8","observation_id":"b27cfc5b-8070-4529-8f6b-b4934ec0c0ac","resolution":{"observed_at":"2026-08-16T12:37:36.261244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T12:37:36.264651Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.264651Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:05b7f0ed8dfc2ee0c31693d94c010c822c0e2fc832bf9214f4d4d81cd239e778","observation_id":"ec363ae7-6085-4fd0-8ed9-1d9c0af324bc","resolution":{"observed_at":"2026-08-16T12:37:36.264651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.268775Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.268775Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2df71314a9fd0214fd014d02cafeae2fafb764ad2f2e1b47e0ad5b6b5c990d3e","observation_id":"16ecfce0-7101-4a7e-b91e-ef1b3bd77a7f","resolution":{"observed_at":"2026-08-16T12:37:36.268775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.044683Z","title":"What can transformers learn in-context? a case study of simple function classes","venue":null,"work_id":"ad99ff50-b4ab-45fa-8c03-74f71b95d637","year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.272216Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2406e88b9677931532117ac9feb82838520bdb5b5fd7c0b55e84ef4f8868c9c6","observation_id":"dacfa710-47cd-4a08-a7fc-71c7dafc86e4","resolution":{"observed_at":"2026-08-16T12:37:37.048571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.276369Z","title":"Analogy-based detection of morphological and semantic relations with word embeddings: what works and what doesn`t","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.276369Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:5398d5fdd2107edf7bd56d673449144abcb9277a653d247ba06c1628e313a456","observation_id":"8011d74e-f40c-4da3-a142-ecbac4602b57","resolution":{"observed_at":"2026-08-16T12:37:36.276369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.280450Z","title":"OLM o: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.280450Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:e040d1a576afe9cabda6a801d2a52b1e8880f7cc2b6672ec6158c60d1446cb7d","observation_id":"0f6d728a-31b0-4b19-b183-0614e70e8c81","resolution":{"observed_at":"2026-08-16T12:37:36.280450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.032836Z","title":null,"venue":null,"work_id":"671c1cd0-8c39-43bc-8cc4-07e68afb08f6","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.284194Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:12d51ec00063b05a845e9168a58034bd95b99e193ca9486181baade4f073f950","observation_id":"61de6d86-90cd-4feb-8723-69a9970c8ba9","resolution":{"observed_at":"2026-08-16T12:37:37.036827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.287788Z","title":"In- Context Learning Creates Task Vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.287788Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:849d4e83b42b1cb5fe9ffa1fda02050cd8fe3179f2c118dfbc47e636195e5710","observation_id":"fc1f87f2-39a9-495b-94b9-fdc8f5cd209b","resolution":{"observed_at":"2026-08-16T12:37:36.287788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.292061Z","title":"Linearity of relation decoding in transformer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.292061Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:89f12d0eed0479a321c497e393d0dc69567d56b05bd6a4648351e3602c42f952","observation_id":"935a2fb3-0694-45eb-8236-cd6caac42e6d","resolution":{"observed_at":"2026-08-16T12:37:36.292061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.294958Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.294958Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:a6aad7bf58eb3783f877cf39beac77b047f132538ef2fb0183e39d0bff08c2ed","observation_id":"ef2593e1-8db3-4dca-af3f-113b8d36f760","resolution":{"observed_at":"2026-08-16T12:37:36.294958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.005203Z","title":"On the origins of linear representations in large language models","venue":null,"work_id":"520412c8-e187-4333-97d7-e745f6527a9d","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.297826Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:c18816933704a1784b9e34bb5cd53b11c3f6ec7894b817d5e9eb8bebf469606a","observation_id":"1820c1dd-5bb4-4953-ad68-da5d79e0ca4a","resolution":{"observed_at":"2026-08-16T12:37:37.010624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w18-2905","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.524673Z","title":null,"venue":null,"work_id":"1aba2e91-481a-4c77-813e-83dec4f7037c","year":2018},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.300566Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:cd30f886f377fe151eb7838ae432d8634915efc3455d357bd1cb5c7487d4e0ad","observation_id":"28864f5b-e906-4a6e-9f25-80469d09aa74","resolution":{"observed_at":"2026-08-16T12:37:36.528778Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.992811Z","title":"Multilingual reliability and semantic structure of continuous word spaces","venue":null,"work_id":"00a4303b-4ef2-48fc-b5af-660312b3ec83","year":2015},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.303582Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:11354c45fafe06f7de87db90e1818d8a4f785f91c29709fc67da45e982222247","observation_id":"63c8a6f8-3f32-4c64-969c-15cb5e33744f","resolution":{"observed_at":"2026-08-16T12:37:36.996973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.307341Z","title":"A pretrainer`s guide to training data: Measuring the effects of data age, domain coverage, quality, & toxicity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.307341Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:918aea260b2ba8dd04927da6f7cd78225cc234222025d59d4fe0ab2fd10e97ed","observation_id":"9646f0d9-ee4c-458e-8ced-9bf0aaa0b3ba","resolution":{"observed_at":"2026-08-16T12:37:36.307341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.314919Z","title":"At which training stage does code data help LLM s reasoning? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.314919Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4557cafe8d75118ea4637adf1168e9d6dca892a3011dd89f4a649cdd1ffeb9db","observation_id":"80ebb938-d5d8-4a12-b775-374d0ec56c21","resolution":{"observed_at":"2026-08-16T12:37:36.314919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.317695Z","title":"When not to trust language models: Investigating effectiveness of parametric and non-parametric memories","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.317695Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:70659a5b971dff6367c160d2da911e4f42fad7fbb20ad0ab8dabbdc71ce30656","observation_id":"e08f2e27-05eb-4b4c-b93d-b3ca2e19131e","resolution":{"observed_at":"2026-08-16T12:37:36.317695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.320670Z","title":"Embers of autoregression show how large language models are shaped by the problem they are trained to solve","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.320670Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:a58c10ef9262f696d6384bdc6c0c69de870ea02fddb41e5876e5052796121f80","observation_id":"5148ca2b-7301-431a-9bb8-06e8e79eb9c3","resolution":{"observed_at":"2026-08-16T12:37:36.320670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.323521Z","title":"Language models implement simple W ord2 V ec-style vector arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.323521Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:9a8506beeb8ef4e1351c774e69f6c549d6ea2aa10572131ee65941fd3a0b5aad","observation_id":"7276c5e4-7105-4cd2-a26b-dbe878ecf07d","resolution":{"observed_at":"2026-08-16T12:37:36.323521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-16T12:37:36.326920Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.326920Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:9233afc7b2b94c99d7ea26157562c88c240ff18219cc0386d3936d8b4996f00a","observation_id":"07fb214a-a2e4-4e3b-9bf2-a3ce395845e2","resolution":{"observed_at":"2026-08-16T12:37:36.326920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.967232Z","title":"Distributed representations of words and phrases and their compositionality","venue":null,"work_id":"bf269bf4-ce55-49b6-807c-f83144588da2","year":2013},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.330488Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:a1e1afb9bf8b11765b0185a526443b6ee43403663f35bd52d269bec029577360","observation_id":"d423fe4a-a934-4b57-b535-2dd7941ac934","resolution":{"observed_at":"2026-08-16T12:37:36.970610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.333747Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.333747Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:8d467e6c7f98ae8ff2a9c99fe68f4841b92ec3539a339323ed5329fae51c6e6d","observation_id":"c8898bc0-9f6a-4d58-8c0b-a8504aaba89c","resolution":{"observed_at":"2026-08-16T12:37:36.333747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.955276Z","title":"Zoom in: An introduction to circuits","venue":null,"work_id":"1c266413-9faa-486a-b698-a04295568eb1","year":2020},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.336933Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:e39d8eee6e57e42a1671bda7bea70e73146f112394768398effcf7da7ea53cb2","observation_id":"002554d9-8b63-4da5-9dec-f759a6602b8c","resolution":{"observed_at":"2026-08-16T12:37:36.959877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.341261Z","title":"Chatterji, Faisal Ladhak, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.341261Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:831d15ce0f5f73eab8b06bfdb1a9902e2940136e5a85222374c5cf534642249e","observation_id":"f021bf14-4dde-4a74-9088-6eb57540e730","resolution":{"observed_at":"2026-08-16T12:37:36.341261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.937271Z","title":"Learning Hierarchical Structures with Linear Relational Embedding","venue":null,"work_id":"c946ea07-9276-4097-9394-9048d1881849","year":2001},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.344829Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:515b644738c9a7fe0460ba28b53131e64f5a3912ae765b905f6f802321987b0b","observation_id":"c529b3bc-2e8f-452b-bdf4-4a5c14891550","resolution":{"observed_at":"2026-08-16T12:37:36.940678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.925269Z","title":"The Linear Representation Hypothesis and the Geometry of Large Language Models","venue":null,"work_id":"bdd932c9-40b4-4602-9496-7ac1969c9c32","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.349063Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:29df721e276cf2545ab377446d96e56b15f0204865091f2f808e461b3e8bb505","observation_id":"059f7a5b-ed0e-4560-abea-b6611f4a5ae9","resolution":{"observed_at":"2026-08-16T12:37:36.929566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.352815Z","title":"G lo V e: Global vectors for word representation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.352815Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:fa10be47c7904d4044cca837c3a1cf65112a176e31b74b7f2eaffc6810700c41","observation_id":"78bf24e7-b5fc-47f4-98f7-6dbc93b669ab","resolution":{"observed_at":"2026-08-16T12:37:36.352815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.913312Z","title":"Null it out: Guarding protected attributes by iterative nullspace projection","venue":null,"work_id":"dc757c21-385c-406a-b348-87d535f61cd9","year":2020},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.356294Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4963280e25e6ea113b272c1c909ddf5f0c2f8970b110bbe3bcee343c9e2495e5","observation_id":"e8e3a177-e391-4a5d-b57d-a290d40dad70","resolution":{"observed_at":"2026-08-16T12:37:36.917292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.359724Z","title":"Impact of pretraining term frequencies on few-shot numerical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.359724Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:7769062193433a4c1ed3bb1a4a6a446f888af51a3c4620c37d48b2c9988ac222","observation_id":"a78393f9-dd28-4252-89bc-4b33ca76a95d","resolution":{"observed_at":"2026-08-16T12:37:36.359724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.901516Z","title":"Backtracking mathematical reasoning of language models to the pretraining data","venue":null,"work_id":"2dfa0d13-16db-4fdb-a2ec-d41069a44cfb","year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.362674Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:b39ac1da9fbd35d213404a99c8bf76da49ebf32f78d0f230055b60022875f6a2","observation_id":"77363836-c1b2-4098-b3eb-386f16046404","resolution":{"observed_at":"2026-08-16T12:37:36.905434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.365962Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.365962Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:352b2828e48d477e80eb123a5fbfa4fe1eea434c06c4525ab4eea0d330ec4747","observation_id":"439fd0fe-b768-4db5-8271-0a4eea112db9","resolution":{"observed_at":"2026-08-16T12:37:36.365962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.369689Z","title":"Salton, A","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.369689Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:6dcf0d868dec8038868c9113dba08efc2f1353870da7261a6d709702d1edd95e","observation_id":"f2046014-23a3-4e24-a48e-82f066f28c8c","resolution":{"observed_at":"2026-08-16T12:37:36.369689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.372202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.372202Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:d0f7429779f58b728ab3758a4d0cad08d38c0b5fe878881f1d7e9c6213483e04","observation_id":"dd67bddf-8ca1-4c1e-b87e-44f74ebb32a4","resolution":{"observed_at":"2026-08-16T12:37:36.372202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.375367Z","title":"The bias amplification paradox in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.375367Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:5723b42a2c6aa82147f38300abdb671c0f5f7c001d613adf9c80348746ae2932","observation_id":"3f630405-b32b-49dd-a1de-c818931f275e","resolution":{"observed_at":"2026-08-16T12:37:36.375367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.378430Z","title":"Detecting pretraining data from large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.378430Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:29808ced09f062cdbea8c6c109f30a9f04d64be667d3bb41fa4d64d3a66fbe1f","observation_id":"f37685d7-e8c3-4065-99d2-e447deaff3da","resolution":{"observed_at":"2026-08-16T12:37:36.378430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.381493Z","title":"Membership inference attacks against machine learning models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.381493Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:fe1726b9bb45d3d23c6462bda2cc3f49ff5c7f36775caba2d825a85004513a21","observation_id":"707bccd1-206e-49a4-ad5f-103f29e67cc9","resolution":{"observed_at":"2026-08-16T12:37:36.381493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.385139Z","title":"The curious case of hallucinatory (un)answerability: Finding truths in the hidden states of over-confident large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.385139Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:3de09923ce06cf4d6612aaac00f077ebaa238edd78c5c76648f78e97c20110a2","observation_id":"8bdb9137-e7d0-4ed3-b297-acb6ea1f6d2a","resolution":{"observed_at":"2026-08-16T12:37:36.385139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.388267Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.388267Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:aecbfbdb8657da3e67a022e98c4282acaece688e4890a8308c265f6348343511","observation_id":"87c6a1e0-ac1d-4729-875f-966a3e12ef57","resolution":{"observed_at":"2026-08-16T12:37:36.388267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.390855Z","title":"Extracting Latent Steering Vectors from Pretrained Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.390855Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4ab9fe9c5ef0558922495b07ad475da9338108ce5910ddb78c94e407f3c14ef5","observation_id":"c8182546-7004-4d5e-b677-b7a59e917a92","resolution":{"observed_at":"2026-08-16T12:37:36.390855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06024","last_updated":"2022-07-05T13:54:26Z","snapshot_observed_at":"2026-08-13T18:12:46.795244Z","submitted_at":"2021-09-13T14:54:39Z","title":"Formalizing and Estimating Distribution Inference Risks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06024","snapshot_observed_at":"2026-08-16T12:37:36.393954Z","title":"Formalizing and estimating distribution inference risks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.393954Z"},"links":{"cited_paper":"/paper/2109.06024","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:09ff7d9b9f8b4eba26532303fafa34c5b1f71b247bcbde3b00c0abc249ac3dc0","observation_id":"3bf08ac5-ee0c-47ea-af86-ba018a230d97","resolution":{"observed_at":"2026-08-16T12:37:36.393954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.877497Z","title":"Scaling Monosemanticity : Extracting Interpretable Features from Claude 3 Sonnet","venue":null,"work_id":"498104b4-2c39-48fe-bea2-ce60c1b05f38","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.397117Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:26139117c692f740a65854f4dea73a21ca368f848514fdaeaa045d5291694b11","observation_id":"ab1dba8d-4911-47ac-b555-1fe3ce592346","resolution":{"observed_at":"2026-08-16T12:37:36.880815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.399886Z","title":"Function vectors in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.399886Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:da8741cc232839b7687f0a54bea04cd2d3d2a76aaab062c1930884eb2b4ad1e9","observation_id":"c10e049a-c1a9-429b-a62f-f7d6d78e05fd","resolution":{"observed_at":"2026-08-16T12:37:36.399886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.402311Z","title":"GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.402311Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:b3865365f529d22a73beeedeee47adc18f28c78f4378db2b201315a28cc0045f","observation_id":"980dfd8b-4b2f-4b44-866e-321f219ce919","resolution":{"observed_at":"2026-08-16T12:37:36.402311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.850325Z","title":"Understanding reasoning ability of language models from the perspective of reasoning paths aggregation","venue":null,"work_id":"ea93f0b1-5db2-467a-b187-790c99fe20c9","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.405447Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:472992722ee6d3e2afb8ba3c5b0a0d35c043557ae2204a3456deddf5b2787ffe","observation_id":"2d105eac-e5ca-42f4-b4de-233b54968e97","resolution":{"observed_at":"2026-08-16T12:37:36.855643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.408579Z","title":"Generalization v.s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.408579Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:e76570e33cc0bbc1111c5785da2aad8b890035a693274994fe1a35476135c520","observation_id":"a2631398-a306-4511-9fc1-44dc66fb242d","resolution":{"observed_at":"2026-08-16T12:37:36.408579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.411183Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.411183Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:33c9acecd36e866fd11516ae02efc6b470daad488d2d925e6de001bcfdf63012","observation_id":"2f03f27a-ce68-4dbd-8a02-dd110def5698","resolution":{"observed_at":"2026-08-16T12:37:36.411183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.413796Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.413796Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:a08bea2961bd5363cf4da3a4754c78f2df9c107a651abdf1d39d64e79b3a2cbf","observation_id":"c1b8bedb-0c0b-4e4e-aca8-801ac0042f62","resolution":{"observed_at":"2026-08-16T12:37:36.413796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.417232Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.417232Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:ae2387d112aa6fdeb1b4a03a4b36e09087e52ab0ecfd8b2f546809f305c64f22","observation_id":"10cc502b-2936-448a-a369-1dcf261fe555","resolution":{"observed_at":"2026-08-16T12:37:36.417232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.420669Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.420669Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:f1bbbe03c6fdd6659430bc1b72adec850a3a4816cbf93618eee59a995df5e309","observation_id":"9f53c3e7-0937-4ab4-9c36-cbe7f4006e84","resolution":{"observed_at":"2026-08-16T12:37:36.420669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.423808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.423808Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:3eacba6b2b783d9a08483a6a2cbb8bdf54bc7c1a5fff24930405076b14adcc36","observation_id":"4fd38eb4-93c0-4589-96fe-51cfee1bf51e","resolution":{"observed_at":"2026-08-16T12:37:36.423808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T12:28:54.594299Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 4 inbound Pith citation observations for arXiv:2504.12459."}