Pith. sign in

Paper Citation Record · LEDGER

Toward Preference-aligned Large Language Models via Residual-based Model Steering

As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2509.23982.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.23982 v2

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T14:43:21.314750Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-25T05:01:31.560963Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-25T05:05:23.125298Z

Reference resolution

50 of 50 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved50
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a7066031-e74f-455a-ac42-96f14ad64a3a · outbound

This paper cites Refusal in language models is mediated by a single direction.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Refusal in language models is mediated by a single direction

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.143999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.143999Z digest=sha256:1b7d3eaa19c271bc0f0474a54daafebb77f047aa1e1201977eeddedf1f2147d7

Observation 53860acd-dc0b-4902-8e5d-b863240d7234 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.267212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.267212Z digest=sha256:0bf8ea4eaf751ff37df22aa6d0d363327773dcf850091d30806e3c861b437192

Observation 81c04a43-bacc-4e83-a1c8-54a8cb859a74 · outbound

This paper cites Steering large language model activations in sparse spaces.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering large language model activations in sparse spaces

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.464748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.464748Z digest=sha256:08aea747558e2879d5e6ebc98e48e60c2f9dcb89e0ea589c779e7d621615f1be

Observation cbc1bf02-1480-43e3-a56e-5845f910b198 · outbound

This paper cites LEACE: perfect linear concept erasure in closed form.

Toward Preference-aligned Large Language Models via Residual-based Model Steering LEACE: perfect linear concept erasure in closed form

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.557998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.557998Z digest=sha256:53ca45bf84504099f07c3236e1ffcd053b62659e9b18efc0e3a8940342d23793

Observation 79fb6bcf-b1ae-45ca-9f9d-1bea87fb9b93 · outbound

This paper cites Diff-in-means concept editing is worst-case optimal: Explaining a result by Sam Marks and Max Tegmark , 2023.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Diff-in-means concept editing is worst-case optimal: Explaining a result by Sam Marks and Max Tegmark , 2023

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.644750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.644750Z digest=sha256:c22a9496d8e4677d55feb06ce5518342e5b1d2d6216fd36e13dfb34da3305ff8

Observation 93b1b66c-fcb1-4b37-b0a3-e71106b7986c · outbound

This paper cites Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Think you have Solved Direct-Answer Question Answering? Try ARC-DA, the Direct-Answer AI2 Reasoning Challenge

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.724861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.724861Z digest=sha256:67cbe3d342f1b6e40804162cdac7681254382bacad0c682f9d906f92e9b3ec5c

Observation 7fcab025-31aa-4e6c-9a80-1a423dbc3d41 · outbound

This paper cites Discovering latent knowledge in language models without supervision.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Discovering latent knowledge in language models without supervision

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.824752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.824752Z digest=sha256:ff741ca55ea407d109bba0676b6d7922188824d7b7f5010e68eadf8aa76cc2bd

Observation 1e6d257d-25aa-41b1-a6b3-84ef18312515 · outbound

This paper cites Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Personalized steering of large language models: Versatile steering vectors through bi-directional preference optimization

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:12.974928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:12.974928Z digest=sha256:c6c8db8112781f1d2c6dff18c6426a7e83badd20f84727f70e047a028f403787

Observation fad29e6a-2439-4a5d-b368-a508aab4ba19 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Evaluating Large Language Models Trained on Code

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.209027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.209027Z digest=sha256:b7a08cac4d6cc43401cb3b7e103ce9d941b1b34586f20fb5c582d5e416f12933

Observation d7d4c956-8082-4345-a93a-7cc84eff10b1 · outbound

This paper cites Parallel structures in pre-training data yield in-context learning.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Parallel structures in pre-training data yield in-context learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.409349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.409349Z digest=sha256:dcbdd80c94b2a784b43ea1184ac488ccebae86ebfd9c3d0b977632beb1ad1fb2

Observation 308757df-3df9-4a29-b1f1-ca5d0e7799c5 · outbound

This paper cites Persona Vectors: Monitoring and Controlling Character Traits in Language Models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Persona Vectors: Monitoring and Controlling Character Traits in Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.544748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.544748Z digest=sha256:5eb31eb0c22523987ca8b1027d52f975939877801e1310f464c8cff0405827b4

Observation bfc6b6e5-971a-44ac-b6cd-f96a35498b64 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Training Verifiers to Solve Math Word Problems

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.683380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.683380Z digest=sha256:88db684182629e4ac05631be2374cba10496dbb8ff9d3ef354db63f40301efa4

Observation e4cff832-77cb-417d-897f-6cb8392e6a17 · outbound

This paper cites The Llama 3 Herd of Models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The Llama 3 Herd of Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:13.887790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:13.887790Z digest=sha256:bd27e0005323bacd6de6a81d9b5757093c6fc7af69643e9f0bd537e0e3408191

Observation 4ea6cd76-a948-420e-9a44-749d40a393fe · outbound

This paper cites Toy Models of Superposition.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Toy Models of Superposition

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.064746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.064746Z digest=sha256:51c2b491c87b3ec88316ffb137d4fa004a25016bf1642c7ba6038af7d8b784f4

Observation 70b8e7d6-bf7a-4837-a42a-f6d4e5999812 · outbound

This paper cites The language model evaluation harness, 2024.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The language model evaluation harness, 2024

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.254757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.254757Z digest=sha256:eec5a3c9680ebb946980efbae71075fb501be66c91991d3acd1e5bf17c23d130

Observation 88198547-a9b0-4c5f-9827-30a2996c8b06 · outbound

This paper cites Measuring massive multitask language understanding.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Measuring massive multitask language understanding

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.434762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.434762Z digest=sha256:9944be2ebbda35b5d5261df61244923ea4e76e07f16216a52322bdde222164aa

Observation 4a2dbd9f-48c3-434c-8c7f-bb105eef19c9 · outbound

This paper cites The low-dimensional linear geometry of contextualized word representations.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The low-dimensional linear geometry of contextualized word representations

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.594748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.594748Z digest=sha256:ec205edff526061260ca9c948adda49d2afcf428d7a3878baa7c0efdf8021af0

Observation ae43ee9f-22be-4d38-ad16-5a6dc0b5b37a · outbound

This paper cites ORPO : Monolithic preference optimization without reference model.

Toward Preference-aligned Large Language Models via Residual-based Model Steering ORPO : Monolithic preference optimization without reference model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.704843Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.704843Z digest=sha256:50f65502cf364bb558347b6ac1e2d3412b46cba4d09c31a4867354948c6fa519

Observation d91f008a-f6fe-461b-8b17-f99be0565563 · outbound

This paper cites Sparse autoencoders find highly interpretable features in language models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Sparse autoencoders find highly interpretable features in language models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:14.875750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:14.875750Z digest=sha256:305518ee0530f3bb34d49d86cc98c6e76458e0aa6435b5f65ae311738aa8ff23

Observation d828aca1-dacb-47ea-a1b7-aaf22f829161 · outbound

This paper cites Mistral 7B.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Mistral 7B

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.054748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.054748Z digest=sha256:239c1848bb8c57e33ac339c3bc13a1709eb70def2c83a062615c82849ee6f720

Observation ebf5bc74-e24a-44e4-90e2-a0a6b39cf570 · outbound

This paper cites LMD 3: Language model data density dependence.

Toward Preference-aligned Large Language Models via Residual-based Model Steering LMD 3: Language model data density dependence

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.184754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.184754Z digest=sha256:e20e2a0519e61e5279dc3f66a4a0ed343196344042c3c40a9255e477ffb65ce7

Observation 79422e0a-7acd-4d2f-b4c3-dbe52f5adca3 · outbound

This paper cites o pf, Yannic Kilcher, Dimitri von R \.

Toward Preference-aligned Large Language Models via Residual-based Model Steering o pf, Yannic Kilcher, Dimitri von R \

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.361603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.361603Z digest=sha256:892a1c45e1b54ed899ffc07caeece2e87680056781491d40bbaa9074a1be92ab

Observation 0702b72c-a1bd-4e7f-8bff-6e7e8eaa4cd0 · outbound

This paper cites Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.444750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.444750Z digest=sha256:49b532bb3a8a7b5e11f4243ae95c76088cb354ca94dadb60d14c0a071af167a4

Observation 1b81097b-bd36-49f7-ac2b-dd113474472b · outbound

This paper cites Li, Maxwell Nye, and Jacob Andreas.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Li, Maxwell Nye, and Jacob Andreas

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.644877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.644877Z digest=sha256:51294554ccb9af91133020c1e3d9acc431dd1995dd6c2cacbaad9dcd7e90fc14

Observation 144fb43e-21ca-4e76-8233-a559922e3fee · outbound

This paper cites Vi \' e gas, and et al.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Vi \' e gas, and et al

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:15.774753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:15.774753Z digest=sha256:55b2aeed484aa7190513a75ee74a41b198ff36bb269172af5e4ac34551bf5090

Observation db5ad6e3-b19c-4156-b97f-150516ef1319 · outbound

This paper cites Fundamental capabilities and applications of large language models: A survey.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Fundamental capabilities and applications of large language models: A survey

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.134752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.134752Z digest=sha256:20269b736e287594b4ce87726f5c8397cae522648f21589105438f2867a86b6b

Observation c05607f3-0148-471f-8d49-674894a6d486 · outbound

This paper cites T ruthful QA : Measuring how models mimic human falsehoods.

Toward Preference-aligned Large Language Models via Residual-based Model Steering T ruthful QA : Measuring how models mimic human falsehoods

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.315534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.315534Z digest=sha256:40a4b8b2b3280eb7d9558cb106a7622803c236485a36cf5cf96021f284fd7776

Observation fd3602db-1976-4a9d-ab23-b1e2fa136f63 · outbound

This paper cites Aligning large language models with human preferences through representation engineering.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Aligning large language models with human preferences through representation engineering

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.561775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.561775Z digest=sha256:4f06da84ae840f401051485fa75dc42e25dce63fb2cb6081bca310e8affc6e2e

Observation 46232db0-ecbd-4603-b717-3cf494164c19 · outbound

This paper cites SimPO: Simple Preference Optimization with a Reference-Free Reward.

Toward Preference-aligned Large Language Models via Residual-based Model Steering SimPO: Simple Preference Optimization with a Reference-Free Reward

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.795032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.795032Z digest=sha256:19dd55e3108e1e987ef517490608a3a5e57b478c785d20c2702d10f70c8096a9

Observation f3418d53-1c4a-482d-9a50-0af3de03c489 · outbound

This paper cites Emergent linear representations in world models of self-supervised sequence models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Emergent linear representations in world models of self-supervised sequence models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:16.994750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:16.994750Z digest=sha256:facf836debab0eb43b1ffae534eb7db01e45e6420cf3d93c4f394dbdccc4800d

Observation c1c33619-4d4f-49d3-a22b-f65c2f731370 · outbound

This paper cites 2 OLMo 2 Furious.

Toward Preference-aligned Large Language Models via Residual-based Model Steering 2 OLMo 2 Furious

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.173482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.173482Z digest=sha256:3f71847c0f8e9e621e0efd3ba92c99d053a407aee0fd831b7629177e84010472

Observation b687dfa6-ada5-4291-89bb-763c0a15ba51 · outbound

This paper cites Training language models to follow instructions with human feedback.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Training language models to follow instructions with human feedback

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.394752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.394752Z digest=sha256:185c8d95f2a81c1f21d5b028572d708444cae11a2f6fe68596563b9b392d8ffe

Observation 35565024-5e6a-4aaa-bf2b-d375c635f2d8 · outbound

This paper cites The linear representation hypothesis and the geometry of large language models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering The linear representation hypothesis and the geometry of large language models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.528077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.528077Z digest=sha256:7fa03417eaeeb6e6e5a5e1a488c3da6ef93654f05e557bd7767f3ecb7ecbe551

Observation 865360a5-6247-4fe1-ae79-ceba8e5774cc · outbound

This paper cites tinyBenchmarks: evaluating LLMs with fewer examples.

Toward Preference-aligned Large Language Models via Residual-based Model Steering tinyBenchmarks: evaluating LLMs with fewer examples

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:17.824932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:17.824932Z digest=sha256:7a6d44364b0e24812aa822f8b779dd87e2f042c5d4b0be9b49e158e30c39cacd

Observation bf62e150-484b-417a-a4a2-21b94c10a541 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Manning, Stefano Ermon, and Chelsea Finn

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.005111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.005111Z digest=sha256:be21e7101cdba4da34824f8f5721facb68df3c3c6ab92b88ee7c31f77df75464

Observation a5a1b8a8-7a7d-470d-8626-f37f722e63d6 · outbound

This paper cites Steering llama 2 via contrastive activation addition.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering llama 2 via contrastive activation addition

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.294744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.294744Z digest=sha256:4aeca9e46a71f89753fc4bb8992256e6b04e7110a3a04a23c80ca42addde3243

Observation 5810186a-a2da-4be2-87ce-31d1ec6678d3 · outbound

This paper cites Winogrande: An adversarial winograd schema challenge at scale.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Winogrande: An adversarial winograd schema challenge at scale

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.525598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.525598Z digest=sha256:f374d4da1a666cc44d7e91e19349ae6adb0f29764b7d979500e3d9a9aad19de1

Observation 72010ca9-59cd-4097-9f61-d4d4c9ec3fed · outbound

This paper cites Detection and measurement of syntactic templates in generated text.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Detection and measurement of syntactic templates in generated text

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.684758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.684758Z digest=sha256:f17f954b967f34e74f6e9929a1739dd14b1c946ad7cb641803d0ca58a4e58f72

Observation 4e8b61c0-0c8b-4831-af0b-c82385093b46 · outbound

This paper cites Large Language Model Alignment: A Survey.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Large Language Model Alignment: A Survey

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.824756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.824756Z digest=sha256:6e98d07633df3d5dd8029a7a0bc406fd2249ff4fa693c3c409bdc1f225695413

Observation d640ac31-b7a3-443d-ab2d-580c908be2ec · outbound

This paper cites A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models.

Toward Preference-aligned Large Language Models via Residual-based Model Steering A survey on sparse autoencoders: Interpreting the internal mechanisms of large language models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:18.924873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:18.924873Z digest=sha256:3ebaf82b41eadebed5bcfe50b3bc4ab9be22ad81e14214dd19812b824d003378

Observation b433cce3-906b-48bf-81fb-7309d8d40feb · outbound

This paper cites Learning to summarize with human feedback.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Learning to summarize with human feedback

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.144752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.144752Z digest=sha256:fb2a5fd83faf916b562937f9a78ec6c04e661465f5d76995a52c1bcf37a6bf1d

Observation 09a566d0-9bda-4445-b51a-bb13fa396788 · outbound

This paper cites Hollinsworth, Atticus Geiger, and Neel Nanda.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Hollinsworth, Atticus Geiger, and Neel Nanda

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.393688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.393688Z digest=sha256:68de67dfd1b9dc535303c715e9c6ac374f08615f6d641d519db1df4504568a85

Observation 821e0b59-0ad4-4bdb-bafc-cdfb2c97d404 · outbound

This paper cites Steering Language Models With Activation Engineering.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Steering Language Models With Activation Engineering

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.610006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.610006Z digest=sha256:7e2d4dea42f6cb482a1acd98039987ece5264805fdbc4af65bbed956678560d0

Observation deaaa5d5-8995-4668-994d-06a8fac37e73 · outbound

This paper cites Aligning Large Language Models with Human: A Survey.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Aligning Large Language Models with Human: A Survey

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:19.875156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:19.875156Z digest=sha256:e53d2ff575ee76f790ff38941d6d0af921e55e07cb266228958b39fbba2798b7

Observation 1ceb96b0-9f8b-430c-9200-967ca2c7e115 · outbound

This paper cites Beyond prompt engineering: Robust behavior control in LLM s via steering target atoms.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Beyond prompt engineering: Robust behavior control in LLM s via steering target atoms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.014570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.014570Z digest=sha256:41750298f90a1fc36de09d3b6110a126740bde12f25d711425ea594e26805bb3

Observation ad6bd5f0-081f-4f96-874c-54d299b1e61c · outbound

This paper cites Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.214767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.214767Z digest=sha256:2f1a8bad07ae38d26bc8f61b6cc68997382bc470276e6ceef0d52e7747c46ce7

Observation a9906af5-d761-4b23-b467-e090e82befde · outbound

This paper cites Generalization v.s.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Generalization v.s

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.394762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.394762Z digest=sha256:52a215c5f06f22a89430b9ec8c1fb784aa4facb16363212e55d37c341d211a46

Observation 3ef2c149-b0eb-4d06-be40-08bda14f1821 · outbound

This paper cites H ella S wag: Can a machine really finish your sentence? In Proc.

Toward Preference-aligned Large Language Models via Residual-based Model Steering H ella S wag: Can a machine really finish your sentence? In Proc

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:20.764759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:20.764759Z digest=sha256:aa6c95192b11cdb6957cfe5a5c131e3723c5f1e84b5fdd76bccefc3d00f812b0

Observation 1b5e7c8f-fa56-41d5-a870-6d1aeb4794dd · outbound

This paper cites Towards best practices of activation patching in language models: Metrics and methods.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Towards best practices of activation patching in language models: Metrics and methods

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:21.054749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:21.054749Z digest=sha256:2a1229043797ca6f52cc5e5fd5f4ce46b58c8b69a0349f719219631d0c67f87e

Observation 04735ae7-d6cb-4e15-8027-d9165c427c76 · outbound

This paper cites Representation Engineering: A Top-Down Approach to AI Transparency.

Toward Preference-aligned Large Language Models via Residual-based Model Steering Representation Engineering: A Top-Down Approach to AI Transparency

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-04T14:43:21.314750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:43:21.314750Z digest=sha256:3b52a8165fdac4f55b20583fd8cc8406c4928b2f3380a62e99c6b17318f93ebe

Pith citing papers

Observation 2d53874f-e7fb-4f91-81b1-79e2043f9197 · inbound

Convex Optimization for Alignment and Preference Learning on a Single GPU cites this paper.

Convex Optimization for Alignment and Preference Learning on a Single GPU Toward Preference-aligned Large Language Models via Residual-based Model Steering

Reference 89

Resolution
verified exact
arxiv_id, observed 2026-06-11T02:09:25.231208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-25T05:01:31.560963Z digest=sha256:de1652d48f325fa7a6ab580f14b833fdde0419b529ea0fbf93fbdf3c08b8032d