{"as_of":"2026-08-08T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3aa0f57ad05e08f6afb51130f065b4480cc1d38ed8b9a584bed528477a70ed8","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:44:56.708066Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T19:22:43.082083Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T19:23:40.845848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"cited_work":{"arxiv_id":"2509.00373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00373","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acti- vation steering meets preference optimization: Defense against jailbreaks in vision language models.arXiv preprint arXiv:2509.00373","venue":null,"work_id":"8128080a-7068-422f-8a0b-7f985976779b","year":null},"citing_paper":{"arxiv_id":"2605.15687","last_updated":"2026-05-15T07:22:43Z","snapshot_observed_at":"2026-07-06T23:26:56.013191Z","submitted_at":"2026-05-15T07:22:43Z","title":"ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T19:22:43.082083Z"},"links":{"cited_paper":"/paper/2509.00373","citing_paper":"/paper/2605.15687"},"observation_digest":"sha256:50b0619d102c593076b6157eb9cf6b745d03d5709a23c0c3fefe53392dc6347a","observation_id":"f4736f01-8815-4b13-9e3e-564cff6477db","resolution":{"observed_at":"2026-05-20T19:23:40.847621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00373/citation-record","integrity":"/paper/2509.00373/integrity","json":"/paper/2509.00373/citation-record.json","paper":"/paper/2509.00373"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.00045","last_updated":"2024-07-29T18:19:35Z","snapshot_observed_at":"2026-08-07T01:32:56.141077Z","submitted_at":"2024-05-28T05:10:40Z","title":"Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00045","snapshot_observed_at":"2026-08-05T13:44:55.560366Z","title":"Nicholas Carlini, Milad Nasr, Christopher A Choquette-Choo, Matthew Jagielski, Irena Gao, Pang Wei W Koh, Daphne Ippolito, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.560366Z"},"links":{"cited_paper":"/paper/2406.00045","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:52294803635ea0b23d59e6667f5b4aabc40e536d36790e7727949013b21c55b0","observation_id":"b0708b9c-3417-4db4-a5a7-af4755228e2e","resolution":{"observed_at":"2026-08-05T13:44:55.560366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-05T13:44:55.686334Z","title":"Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Jinrui Yang, Xiawu Zheng, Ke Li, Xing Sun, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.686334Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:81e3b10cc4ffed39e11d2945a077e6ee621d0afbfe917a146a5f42ef1d57e807","observation_id":"3227f213-a1aa-4f19-81e2-84ec332bb600","resolution":{"observed_at":"2026-08-05T13:44:55.686334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-05T13:44:55.736911Z","title":"Samuel Gehman, Suchin Gururangan, Maarten Sap, Yejin Choi, and Noah A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.736911Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:4725a853efb7611e4f2b5d5c1b3ee9960f2c9f6cbab16562969f880fed26963c","observation_id":"abffdf20-d6b4-49db-b979-225b93a0e9c2","resolution":{"observed_at":"2026-08-05T13:44:55.736911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:55.911424Z","title":"org/abs/2502.01042","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.911424Z"},"links":{"citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:589997ade548ad50a6a4a22f9cc83f45a700796b8678dd6d6e552f21dffba80e","observation_id":"348f2d69-e9be-4c67-a1e5-92c1f97f128c","resolution":{"observed_at":"2026-08-05T13:44:55.911424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03341","last_updated":"2024-06-26T14:11:53Z","snapshot_observed_at":"2026-07-06T15:38:58.578200Z","submitted_at":"2023-06-06T01:26:53Z","title":"Inference-Time Intervention: Eliciting Truthful Answers from a Language Model","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03341","snapshot_observed_at":"2026-08-05T13:44:55.970593Z","title":"Qing Li, Jiahui Geng, Zongxiong Chen, Kun Song, Lei Ma, and Fakhri Karray","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.970593Z"},"links":{"cited_paper":"/paper/2306.03341","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:935e240f7580f292eabb85f746802ef770096e61b072fd29de1bc70709d5b037","observation_id":"a4ea9379-7816-4e1a-ae76-8f8b17bb589c","resolution":{"observed_at":"2026-08-05T13:44:55.970593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-05T13:44:56.020846Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.020846Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:0c6f46e6786df6e8e23591968d292fe9ebe1d558b238880bbce9d82fa86bac3d","observation_id":"4a534b28-1ab2-4c06-b50e-4a969a466e5e","resolution":{"observed_at":"2026-08-05T13:44:56.020846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T13:44:56.091583Z","title":"Zhenxing Niu, Haodong Ren, Xinbo Gao, Gang Hua, and Rong Jin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.091583Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:80ef5d2808705b3501815e711e6a200b9ce0a6f33cbf51a5b4716010c617c4bd","observation_id":"95ee2fb0-ff21-425e-be10-c99c8bf9b066","resolution":{"observed_at":"2026-08-05T13:44:56.091583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T13:44:56.147734Z","title":"Kiho Park, Yo Joong Choe, and Victor Veitch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.147734Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:78b2f5129922deefcc9fab5e5d9aeacf98971a2b7a9c1cacc6b7436d7ae2bd65","observation_id":"3b940c23-c3cf-4361-8f61-dc2aa2003cf5","resolution":{"observed_at":"2026-08-05T13:44:56.147734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03658","last_updated":"2024-07-17T22:24:27Z","snapshot_observed_at":"2026-07-06T16:43:58.947915Z","submitted_at":"2023-11-07T01:59:11Z","title":"The Linear Representation Hypothesis and the Geometry of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03658","snapshot_observed_at":"2026-08-05T13:44:56.199824Z","title":"Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, and Pra- teek Mittal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.199824Z"},"links":{"cited_paper":"/paper/2311.03658","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:a8d3c8dd6466a8de022cb0679331438b37b4ff3d1739bd922b184a20848a0993","observation_id":"91a1b601-a548-4dff-be26-deed374c2d07","resolution":{"observed_at":"2026-08-05T13:44:56.199824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-07-06T15:45:47.517122Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-05T13:44:56.261344Z","title":"Christian Schlarmann and Matthias Hein","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.261344Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:39a1ae2d266077b1a1d869e544861902258de91795a14ffe727f900d6692d17b","observation_id":"2a5973cb-a02f-4be9-a475-36a9752362cd","resolution":{"observed_at":"2026-08-05T13:44:56.261344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10741","last_updated":"2023-08-21T14:09:09Z","snapshot_observed_at":"2026-07-06T16:08:33.160103Z","submitted_at":"2023-08-21T14:09:09Z","title":"On the Adversarial Robustness of Multi-Modal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10741","snapshot_observed_at":"2026-08-05T13:44:56.319661Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.319661Z"},"links":{"cited_paper":"/paper/2308.10741","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:b9f93f7b5b1129044012e2e5afea6e0b25735bd0500aad75f10c96420e3b1292","observation_id":"f7401d2b-0a18-4308-9b08-2dd5c8c7f73a","resolution":{"observed_at":"2026-08-05T13:44:56.319661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-05T13:44:56.450480Z","title":"Nishant Subramani, Nivedita Suresh, and Matthew E","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.450480Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:2336ca3ed8bbd176aab95d0863a2ea3a0d1f092e7f1fe8deaeb04f1f857cb044","observation_id":"ddd9d865-c49b-4625-bf38-8cd50f50e119","resolution":{"observed_at":"2026-08-05T13:44:56.450480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T13:44:56.510535Z","title":"Han Wang, Gang Wang, and Huan Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.510535Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:1fc7f3516681054887762ed98d5d7ca75a7c6771c4abc58ab7922c02dac5402f","observation_id":"646136b6-51c0-4fa4-95bb-153dfd9e1ad3","resolution":{"observed_at":"2026-08-05T13:44:56.510535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T13:44:56.600389Z","title":"Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr, J","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.600389Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:90b8f0ebead2b54c2464ff0e15b18a869bf5e7f7181706e82d6f2f414847e9db","observation_id":"0c001538-34a8-42f6-9972-7f97dea0a2fb","resolution":{"observed_at":"2026-08-05T13:44:56.600389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T13:44:56.661410Z","title":"Xiaohan Zou, Jian Kang, George Kesidis, and Lu Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.661410Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:d93f96bd5c5df0bbee2c2d4acb9a7e4226d01fa31109e1e03352a669b949f57a","observation_id":"a5373c59-f4d4-4435-8a6e-e0ef15286754","resolution":{"observed_at":"2026-08-05T13:44:56.661410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13095","last_updated":"2025-02-18T18:06:48Z","snapshot_observed_at":"2026-08-07T18:07:37.503310Z","submitted_at":"2025-02-18T18:06:48Z","title":"Understanding and Rectifying Safety Perception Distortion in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13095","snapshot_observed_at":"2026-08-05T13:44:56.708066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.708066Z"},"links":{"cited_paper":"/paper/2502.13095","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:199fd04dea7723701e86fdc14583f3600a8601614b604641f992e4155a6925da","observation_id":"5fbaf813-d142-41e0-8e51-156b1b7b5221","resolution":{"observed_at":"2026-08-05T13:44:56.708066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:57.793198Z","title":"semanticscholar.org/CorpusID:125209808","venue":null,"work_id":"937b4002-2284-44d4-bcc5-43551a948247","year":1901},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.505326Z"},"links":{"citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:0787a8ae5e082b0052661e346dfe693a39bcfaff5638cf1c9c6d7b22cac3f2bb","observation_id":"5fedac94-aaaf-46b5-9e1d-666e7eed10a6","resolution":{"observed_at":"2026-08-05T13:44:57.927865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T13:44:56.384261Z","title":"Nisan Stiennon, Long Ouyang, Jeff Wu, Daniel M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.384261Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:a26d6855c5dc0e9c002a0b90ea2e81632ea46bbe27c85a223e0389fb376b1e7d","observation_id":"7705a784-fd13-4e0a-bbfd-754c2a849208","resolution":{"observed_at":"2026-08-05T13:44:56.384261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-07-06T09:58:19.547859Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-05T13:44:55.794893Z","title":"Yichen Gong, Delong Ran, Jinyuan Liu, Conglei Wang, Tianshuo Cong, Anyu Wang, Sisi Duan, and Xiaoyun Wang","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.794893Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:3d332c6b4e2258652e92ac618c011339022dd440ab17959f03e021a50113e06e","observation_id":"11528131-98cc-44e4-9a0f-d85f6e415ec6","resolution":{"observed_at":"2026-08-05T13:44:55.794893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-05T13:44:55.370516Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.370516Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:97f8ba9fecb327cb3ba0dd9af7b325dd9e01f94cd6bb57588ff1737497edf507","observation_id":"6fe0083e-acf1-4012-91ef-9c0ad18e8301","resolution":{"observed_at":"2026-08-05T13:44:55.370516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T13:44:55.439302Z","title":"Ralph Allan Bradley and Milton E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.439302Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:75abde6925d7125a45a0475b0f9e25c6fbe27940e0456afb139dcc812d435174","observation_id":"997c3dc8-d86b-472d-abb7-23ae05a9a131","resolution":{"observed_at":"2026-08-05T13:44:55.439302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-05T13:44:55.630606Z","title":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.630606Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:1ea379160a7d412019dc8e3dd214f745443c36b0c4094a0262b83953c9ef56a8","observation_id":"4fd7a290-1e3c-4ead-8c4d-74ec6625fbee","resolution":{"observed_at":"2026-08-05T13:44:55.630606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-05T13:44:55.307039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.307039Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:6ee793be13d2c60c29bea5205a04181452ee9e2f0c405c5d337170cc6f09efd2","observation_id":"6cc7a34f-f324-447c-82fc-6cdea44c5e2d","resolution":{"observed_at":"2026-08-05T13:44:55.307039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T13:44:55.849334Z","title":"Xingang Guo, Fangxu Yu, Huan Zhang, Lianhui Qin, and Bin Hu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.849334Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:fa616597f1ae386bef9809771694d6e161d1c091553a591081a57949418e05cb","observation_id":"c4b7143d-a5e2-4c76-abb8-656d7930f615","resolution":{"observed_at":"2026-08-05T13:44:55.849334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2509.00373."}