Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T22:23:36.717737Z
Paper Citation Record · LEDGER
As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2505.07293.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T22:23:36.717737Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-06-27T12:57:26.458109Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-03T06:07:41.034120Z
58 of 58 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 15052427-48b9-41a9-8b25-c77efce244c3 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 569a43c7-96b9-4512-8f85-cdd643740b12 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b7ade84b-4b54-4018-a42e-bee1c430bb16 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Smollm-corpus,
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2c76a108-f35f-40b1-903f-9d77feff11d3 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Piqa: Reasoning about physical commonsense in natural language
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation aed61845-245e-47aa-98eb-f335b73c0347 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Towards monoseman- ticity: Decomposing language models with dictionary learning
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation 3cf91f5d-d6c8-42ce-925d-e88747df4240 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Efficient Intent Detection with Dual Sentence Encoders
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1baea1ab-b71e-4cca-8a05-cd76f6d155e2 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Evaluating Large Language Models Trained on Code
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c6c97e77-ca05-401c-85fe-9ce465d75f56 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c64a20fe-1d9e-4398-9eef-1b2ae8502e15 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Training Verifiers to Solve Math Word Problems
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a00cb4c-a9d6-484b-9a20-5c363045ed9d · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b36fbfd1-88ab-4571-8ea4-5434f4336146 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Not all heads matter: A head-level kv cache compression method with integrated retrieval and reasoning.arXiv preprint arXiv:2410.19258, 2024
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6a40318b-0c9f-4437-9189-f6318105ea54 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Transformer Feed-Forward Layers Are Key-Value Memories
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7acfe777-81cb-4bb6-a786-6e249ad97c33 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection The Llama 3 Herd of Models
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a88aba2a-ac26-4803-9af0-f023b5bd3126 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Optimizing Pretraining Data Mixtures with LLM-Estimated Utility
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 536a8b14-8458-4a31-87c7-0ef0a3cb05b5 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Measuring Massive Multitask Language Understanding
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d03563a-249c-4f5d-b769-cf0bf78000ac · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Measuring Mathematical Problem Solving With the MATH Dataset
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bdc98545-8281-4dcb-b2a6-0c9efa88a7f3 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Distilling the Knowledge in a Neural Network
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5cbba9c2-fc87-44cc-907f-07727ec3d6d6 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1306cc60-deb5-40fb-b1bd-9a2b326454ae · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7624a982-d77e-4261-b3ba-4d94b28278ca · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d18e8cd2-ecdc-4426-a0e5-248831889a75 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection FastText.zip: Compressing text classification models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9bce7833-f631-49c4-98fb-4c6689a22566 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection The mirrored influence hypothesis: Efficient data influence estimation by harnessing forward passes
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation 305aafe7-e1ab-470a-8712-979f547e8a11 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection RACE: Large-scale ReAding Comprehension Dataset From Examinations
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5dbcc96b-45f7-4856-9eec-336deb053f64 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Datacomp-lm: In search of the next generation of training sets for language models
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4bc5fe5b-f274-4d54-b097-8cebf7207d18 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling Laws
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf3bc0d5-060e-4834-b6ee-e68a1b4bf6a3 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Rho-1: Not All Tokens Are What You Need
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 163f28b4-f51b-4165-a90c-3ea13af6f64c · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection RegMix: Data Mixture as Regression for Language Model Pre-training
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation de5d1edb-5f33-423e-9b9f-477cb03c0a84 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language Models
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d43b5d7a-c0cd-4cb6-b09f-f7d93bb999d9 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d5fc0da0-896e-4e02-8ebf-acdffd5c36c4 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection 2 OLMo 2 Furious
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d7c0278b-4f75-47d2-bd93-13c13b5b2a1a · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection In-context Learning and Induction Heads
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 549d502c-fe53-4c79-8ba9-790de5786f38 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection The fineweb datasets: Decanting the web for the finest text data at scale.Advancesin Neural Information Processing Systems, 37:30811–30849, 2024
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8e477ee4-2df2-4ae2-93ce-7c1326bd5a14 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection DataMan: Data Manager for Pre-training Large Language Models
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation eccd86e7-1eeb-4d3e-a5d7-efc6425c456b · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation d9e3d4bc-8ec3-44a2-81f5-a5fe463174d9 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Scaling Language Models: Methods, Analysis & Insights from Training Gopher
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b1a710f5-84fa-4872-b11f-228ddd6ecf9a · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e4f4725c-4c7c-4f97-a2d8-ab229eb7892a · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection GPQA: A Graduate-Level Google-Proof Q&A Benchmark
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d00461b2-4989-4b1b-bdf6-2e1ae719bfb0 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1215aaac-4870-451d-8d1f-5006b754c1fa · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 27bba49a-c6ab-4884-8771-3e1f26187e7e · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0e8b2492-d185-4735-80b9-9012088498c6 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 27ee5e9c-59fb-450c-ae64-9de5435ad704 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8038c5c9-bb5e-49fb-8d72-70ff9035f7cf · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection LLaMA: Open and Efficient Foundation Language Models
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation da7a92d6-6bd0-4504-8c55-5d2b3b2cf846 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Mmlu-pro: A more robust and challenging multi-task language understanding benchmark
Reference 44
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation f5069de9-453b-47c6-9d16-d3e7e0ac01d1 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection QuRating: Selecting High-Quality Data for Training Language Models
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1648229f-8a32-450f-8ed0-2c1d03f64a6c · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7d1e7c72-9bd7-49a3-8403-c1dcfea521f5 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Retrieval Head Mechanistically Explains Long-Context Factuality
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1106b25-412c-4878-b6d7-a6f0c0abe522 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Doremi: Optimizing data mixtures speeds up language model pretraining.Advances in Neural Information Processing Systems, 36:69798–69818, 2023
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2105e29b-e248-4728-8d25-f58d390110a2 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9088e316-d5e9-46c9-b83e-f793a793c9f1 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Mates: Model-aware data selection for efficient pretraining with data influence models.Advances in Neural Information Processing Systems, 37:108735–108759, 2024
Reference 50
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation 727e857c-c636-488d-a5c8-3c70e7a52234 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection HellaSwag: Can a Machine Really Finish Your Sentence?
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 67b5ae53-835e-4bfe-bd07-633422466e4b · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection DecorateLM: Data Engineering through Corpus Rating, Tagging, and Editing with Language Models
Reference 52
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation e409344f-83e1-4c8e-b326-ab841ba8882b · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Attention Heads of Large Language Models: A Survey
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 37fdae11-9ece-4c3e-95b9-a05642bae739 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8c57fe57-fa0d-4e2a-afdb-205bbbc40cc4 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Focus Directions Make Your Language Models Pay More Attention to Relevant Contexts
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d61d900d-6071-44fc-825a-f19e204938d7 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection "This is a test string
Reference 57
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation c016396b-fa74-44e1-822b-b2eef5aba8ad · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection 26 Figure 18 The cloud maps of the data selected by AttentionInfluence and FineWeb-Edu Classifier, respectively
Reference 58
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.
Observation 6fea8a0a-3d62-4e62-9dbb-15a270189090 · outbound
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection Unresolved cited work
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2ea950b2-81b0-4595-bed0-f55952963bc9 · inbound
Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.