Pith. sign in

Paper Citation Record · LEDGER

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models

As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2509.00373.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.00373 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T13:44:56.708066Z

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-20T19:22:43.082083Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-20T19:23:40.845848Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved23
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b0708b9c-3417-4db4-a5a7-af4755228e2e · outbound

This paper cites Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.560366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.560366Z digest=sha256:52294803635ea0b23d59e6667f5b4aabc40e536d36790e7727949013b21c55b0

Observation 3227f213-a1aa-4f19-81e2-84ec332bb600 · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.686334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.686334Z digest=sha256:81e3b10cc4ffed39e11d2945a077e6ee621d0afbfe917a146a5f42ef1d57e807

Observation abffdf20-d6b4-49db-b979-225b93a0e9c2 · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.736911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.736911Z digest=sha256:4725a853efb7611e4f2b5d5c1b3ee9960f2c9f6cbab16562969f880fed26963c

Observation 348f2d69-e9be-4c67-a1e5-92c1f97f128c · outbound

This paper cites org/abs/2502.01042.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models org/abs/2502.01042

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.911424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.911424Z digest=sha256:589997ade548ad50a6a4a22f9cc83f45a700796b8678dd6d6e552f21dffba80e

Observation a4ea9379-7816-4e1a-ae76-8f8b17bb589c · outbound

This paper cites Inference-Time Intervention: Eliciting Truthful Answers from a Language Model.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Inference-Time Intervention: Eliciting Truthful Answers from a Language Model

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.970593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.970593Z digest=sha256:935e240f7580f292eabb85f746802ef770096e61b072fd29de1bc70709d5b037

Observation 4a534b28-1ab2-4c06-b50e-4a969a466e5e · outbound

This paper cites AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.020846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.020846Z digest=sha256:0c6f46e6786df6e8e23591968d292fe9ebe1d558b238880bbce9d82fa86bac3d

Observation 95ee2fb0-ff21-425e-be10-c99c8bf9b066 · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.091583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.091583Z digest=sha256:80ef5d2808705b3501815e711e6a200b9ce0a6f33cbf51a5b4716010c617c4bd

Observation 3b940c23-c3cf-4361-8f61-dc2aa2003cf5 · outbound

This paper cites Training language models to follow instructions with human feedback.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Training language models to follow instructions with human feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.147734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.147734Z digest=sha256:78b2f5129922deefcc9fab5e5d9aeacf98971a2b7a9c1cacc6b7436d7ae2bd65

Observation 91a1b601-a548-4dff-be26-deed374c2d07 · outbound

This paper cites The Linear Representation Hypothesis and the Geometry of Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models The Linear Representation Hypothesis and the Geometry of Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.199824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.199824Z digest=sha256:a8d3c8dd6466a8de022cb0679331438b37b4ff3d1739bd922b184a20848a0993

Observation 2a5973cb-a02f-4be9-a475-36a9752362cd · outbound

This paper cites Visual Adversarial Examples Jailbreak Aligned Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Visual Adversarial Examples Jailbreak Aligned Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.261344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.261344Z digest=sha256:39a1ae2d266077b1a1d869e544861902258de91795a14ffe727f900d6692d17b

Observation f7401d2b-0a18-4308-9b08-2dd5c8c7f73a · outbound

This paper cites On the Adversarial Robustness of Multi-Modal Foundation Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models On the Adversarial Robustness of Multi-Modal Foundation Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.319661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.319661Z digest=sha256:b9f93f7b5b1129044012e2e5afea6e0b25735bd0500aad75f10c96420e3b1292

Observation ddd9d865-c49b-4625-bf38-8cd50f50e119 · outbound

This paper cites Learning to summarize from human feedback.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Learning to summarize from human feedback

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.450480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.450480Z digest=sha256:2336ca3ed8bbd176aab95d0863a2ea3a0d1f092e7f1fe8deaeb04f1f857cb044

Observation 646136b6-51c0-4fa4-95bb-153dfd9e1ad3 · outbound

This paper cites LaMDA: Language Models for Dialog Applications.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models LaMDA: Language Models for Dialog Applications

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.510535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.510535Z digest=sha256:1fc7f3516681054887762ed98d5d7ca75a7c6771c4abc58ab7922c02dac5402f

Observation 0c001538-34a8-42f6-9972-7f97dea0a2fb · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Fine-Tuning Language Models from Human Preferences

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.600389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.600389Z digest=sha256:90b8f0ebead2b54c2464ff0e15b18a869bf5e7f7181706e82d6f2f414847e9db

Observation a5373c59-f4d4-4435-8a6e-e0ef15286754 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.661410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.661410Z digest=sha256:d93f96bd5c5df0bbee2c2d4acb9a7e4226d01fa31109e1e03352a669b949f57a

Observation 5fbaf813-d142-41e0-8e51-156b1b7b5221 · outbound

This paper cites Understanding and Rectifying Safety Perception Distortion in VLMs.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Understanding and Rectifying Safety Perception Distortion in VLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.708066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.708066Z digest=sha256:199fd04dea7723701e86fdc14583f3600a8601614b604641f992e4155a6925da

Observation 5fedac94-aaaf-46b5-9e1d-666e7eed10a6 · outbound

This paper cites semanticscholar.org/CorpusID:125209808.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models semanticscholar.org/CorpusID:125209808

Reference 1952

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T13:44:57.927865Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T13:44:55.505326Z digest=sha256:0787a8ae5e082b0052661e346dfe693a39bcfaff5638cf1c9c6d7b22cac3f2bb

Observation 7705a784-fd13-4e0a-bbfd-754c2a849208 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Proximal Policy Optimization Algorithms

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.384261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.384261Z digest=sha256:a26d6855c5dc0e9c002a0b90ea2e81632ea46bbe27c85a223e0389fb376b1e7d

Observation 11528131-98cc-44e4-9a0f-d85f6e415ec6 · outbound

This paper cites RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.794893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.794893Z digest=sha256:3d332c6b4e2258652e92ac618c011339022dd440ab17959f03e021a50113e06e

Observation 6fe0083e-acf1-4012-91ef-9c0ad18e8301 · outbound

This paper cites A General Language Assistant as a Laboratory for Alignment.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models A General Language Assistant as a Laboratory for Alignment

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.370516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.370516Z digest=sha256:97f8ba9fecb327cb3ba0dd9af7b325dd9e01f94cd6bb57588ff1737497edf507

Observation 997c3dc8-d86b-472d-abb7-23ae05a9a131 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.439302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.439302Z digest=sha256:75abde6925d7125a45a0475b0f9e25c6fbe27940e0456afb139dcc812d435174

Observation 4fd7a290-1e3c-4ead-8c4d-74ec6625fbee · outbound

This paper cites MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.630606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.630606Z digest=sha256:1ea379160a7d412019dc8e3dd214f745443c36b0c4094a0262b83953c9ef56a8

Observation 6cc7a34f-f324-447c-82fc-6cdea44c5e2d · outbound

This paper cites Refusal in Language Models Is Mediated by a Single Direction.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Refusal in Language Models Is Mediated by a Single Direction

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.307039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.307039Z digest=sha256:6ee793be13d2c60c29bea5205a04181452ee9e2f0c405c5d337170cc6f09efd2

Observation c4b7143d-a5e2-4c76-abb8-656d7930f615 · outbound

This paper cites FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.849334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.849334Z digest=sha256:fa616597f1ae386bef9809771694d6e161d1c091553a591081a57949418e05cb

Pith citing papers

Observation f4736f01-8815-4b13-9e3e-564cff6477db · inbound

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models cites this paper.

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-20T19:23:40.847621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T19:22:43.082083Z digest=sha256:50b0619d102c593076b6157eb9cf6b745d03d5709a23c0c3fefe53392dc6347a