Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-04T14:43:21.314750Z
Paper Citation Record · LEDGER
As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2509.23982.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-04T14:43:21.314750Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-05-25T05:01:31.560963Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-05-25T05:05:23.125298Z
50 of 50 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation a7066031-e74f-455a-ac42-96f14ad64a3a · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Refusal in language models is mediated by a single direction
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 53860acd-dc0b-4902-8e5d-b863240d7234 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 81c04a43-bacc-4e83-a1c8-54a8cb859a74 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering large language model activations in sparse spaces
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cbc1bf02-1480-43e3-a56e-5845f910b198 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering LEACE: perfect linear concept erasure in closed form
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 79fb6bcf-b1ae-45ca-9f9d-1bea87fb9b93 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Diff-in-means concept editing is worst-case optimal: Explaining a result by Sam Marks and Max Tegmark , 2023
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 93b1b66c-fcb1-4b37-b0a3-e71106b7986c · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7fcab025-31aa-4e6c-9a80-1a423dbc3d41 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Discovering latent knowledge in language models without supervision
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1e6d257d-25aa-41b1-a6b3-84ef18312515 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fad29e6a-2439-4a5d-b368-a508aab4ba19 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Evaluating Large Language Models Trained on Code
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d7d4c956-8082-4345-a93a-7cc84eff10b1 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Parallel structures in pre-training data yield in-context learning
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 308757df-3df9-4a29-b1f1-ca5d0e7799c5 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Persona Vectors: Monitoring and Controlling Character Traits in Language Models
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bfc6b6e5-971a-44ac-b6cd-f96a35498b64 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Training Verifiers to Solve Math Word Problems
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e4cff832-77cb-417d-897f-6cb8392e6a17 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering The Llama 3 Herd of Models
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ea6cd76-a948-420e-9a44-749d40a393fe · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Toy Models of Superposition
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 70b8e7d6-bf7a-4837-a42a-f6d4e5999812 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering The language model evaluation harness, 2024
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 88198547-a9b0-4c5f-9827-30a2996c8b06 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Measuring massive multitask language understanding
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a2dbd9f-48c3-434c-8c7f-bb105eef19c9 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering The low-dimensional linear geometry of contextualized word representations
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ae43ee9f-22be-4d38-ad16-5a6dc0b5b37a · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering ORPO : Monolithic preference optimization without reference model
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d91f008a-f6fe-461b-8b17-f99be0565563 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Sparse autoencoders find highly interpretable features in language models
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d828aca1-dacb-47ea-a1b7-aaf22f829161 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Mistral 7B
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ebf5bc74-e24a-44e4-90e2-a0a6b39cf570 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering LMD 3: Language model data density dependence
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 79422e0a-7acd-4d2f-b4c3-dbe52f5adca3 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering o pf, Yannic Kilcher, Dimitri von R \
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0702b72c-a1bd-4e7f-8bff-6e7e8eaa4cd0 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1b81097b-bd36-49f7-ac2b-dd113474472b · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Li, Maxwell Nye, and Jacob Andreas
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 144fb43e-21ca-4e76-8233-a559922e3fee · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Vi \' e gas, and et al
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation db5ad6e3-b19c-4156-b97f-150516ef1319 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Fundamental capabilities and applications of large language models: A survey
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c05607f3-0148-471f-8d49-674894a6d486 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering T ruthful QA : Measuring how models mimic human falsehoods
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fd3602db-1976-4a9d-ab23-b1e2fa136f63 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Aligning large language models with human preferences through representation engineering
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 46232db0-ecbd-4603-b717-3cf494164c19 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering SimPO: Simple Preference Optimization with a Reference-Free Reward
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f3418d53-1c4a-482d-9a50-0af3de03c489 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Emergent linear representations in world models of self-supervised sequence models
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1c33619-4d4f-49d3-a22b-f65c2f731370 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering 2 OLMo 2 Furious
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b687dfa6-ada5-4291-89bb-763c0a15ba51 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Training language models to follow instructions with human feedback
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 35565024-5e6a-4aaa-bf2b-d375c635f2d8 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering The linear representation hypothesis and the geometry of large language models
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 865360a5-6247-4fe1-ae79-ceba8e5774cc · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering tinyBenchmarks: evaluating LLMs with fewer examples
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf62e150-484b-417a-a4a2-21b94c10a541 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Manning, Stefano Ermon, and Chelsea Finn
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a5a1b8a8-7a7d-470d-8626-f37f722e63d6 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering llama 2 via contrastive activation addition
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5810186a-a2da-4be2-87ce-31d1ec6678d3 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Winogrande: An adversarial winograd schema challenge at scale
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 72010ca9-59cd-4097-9f61-d4d4c9ec3fed · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Detection and measurement of syntactic templates in generated text
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4e8b61c0-0c8b-4831-af0b-c82385093b46 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Large Language Model Alignment: A Survey
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d640ac31-b7a3-443d-ab2d-580c908be2ec · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b433cce3-906b-48bf-81fb-7309d8d40feb · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Learning to summarize with human feedback
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 09a566d0-9bda-4445-b51a-bb13fa396788 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Hollinsworth, Atticus Geiger, and Neel Nanda
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 821e0b59-0ad4-4bdb-bafc-cdfb2c97d404 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering Language Models With Activation Engineering
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation deaaa5d5-8995-4668-994d-06a8fac37e73 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Aligning Large Language Models with Human: A Survey
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1ceb96b0-9f8b-430c-9200-967ca2c7e115 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Beyond prompt engineering: Robust behavior control in LLM s via steering target atoms
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ad6bd5f0-081f-4f96-874c-54d299b1e61c · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a9906af5-d761-4b23-b467-e090e82befde · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Generalization v.s
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3ef2c149-b0eb-4d06-be40-08bda14f1821 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering H ella S wag: Can a machine really finish your sentence? In Proc
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1b5e7c8f-fa56-41d5-a870-6d1aeb4794dd · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Towards best practices of activation patching in language models: Metrics and methods
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 04735ae7-d6cb-4e15-8027-d9165c427c76 · outbound
Toward Preference-aligned Large Language Models via Residual-based Model Steering Representation Engineering: A Top-Down Approach to AI Transparency
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d53874f-e7fb-4f91-81b1-79e2043f9197 · inbound
Convex Optimization for Alignment and Preference Learning on a Single GPU Toward Preference-aligned Large Language Models via Residual-based Model Steering
Reference 89
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.