{"as_of":"2026-08-18T13:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b80047bfeb03faf78248320ff66884a275b929a3975edd0bf68d74b6264fc867","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:17:49.131015Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:46:19.440645Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T07:13:16.297937Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15623","snapshot_observed_at":"2026-08-04T17:46:19.440645Z","title":"JailPO: A novel black- box jailbreak framework via preference optimization against aligned LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10682","last_updated":"2025-09-12T20:26:16Z","snapshot_observed_at":"2026-08-12T22:01:07.249587Z","submitted_at":"2025-09-12T20:26:16Z","title":"LLM in the Middle: A Systematic Review of Threats and Mitigations to Real-World LLM-based Systems","version":1},"reference_index":175,"source":"pdf_text","source_observed_at":"2026-08-04T17:46:19.440645Z"},"links":{"cited_paper":"/paper/2412.15623","citing_paper":"/paper/2509.10682"},"observation_digest":"sha256:93e2a2f8227478f7a385130e13d4ee94b3d522e277bac426f0db563ff775617f","observation_id":"bb2d9b8e-3122-4bbf-bf55-803385c302ec","resolution":{"observed_at":"2026-08-04T17:46:19.440645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15623","snapshot_observed_at":"2026-08-03T14:24:21.893602Z","title":"Jailpo: A novel black-box jailbreak framework via preference optimization against aligned llms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.893602Z"},"links":{"cited_paper":"/paper/2412.15623","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:19081bd5466588548f5defdd5d8931101f845b1759c26f4a7d3900c7c9500f04","observation_id":"050f4c5c-0847-4f91-a0ba-2f68a0cbc320","resolution":{"observed_at":"2026-08-03T14:24:21.893602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"cited_work":{"arxiv_id":"2412.15623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15623","snapshot_observed_at":"2026-06-29T07:13:16.297937Z","title":"Hongyi Li, Jiawei Ye, Jie Wu, Tianjie Yan, Chu Wang, and Zhixin Li","venue":null,"work_id":"8f9d43b5-8d65-41f4-837e-fd095f966e9f","year":2024},"citing_paper":{"arxiv_id":"2605.29237","last_updated":"2026-08-15T00:47:06Z","snapshot_observed_at":"2026-08-18T13:12:46.561813Z","submitted_at":"2026-05-28T01:53:14Z","title":"Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T07:10:50.007951Z"},"links":{"cited_paper":"/paper/2412.15623","citing_paper":"/paper/2605.29237"},"observation_digest":"sha256:a73eb34292018a083154be619c495f724d9c1b29829bb0d6ee5dfe6bb8f5e86b","observation_id":"0bb914fe-945d-4138-8a3f-3b35c25e4e5b","resolution":{"observed_at":"2026-06-29T07:13:16.299680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15623/citation-record","integrity":"/paper/2412.15623/integrity","json":"/paper/2412.15623/citation-record.json","paper":"/paper/2412.15623"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T11:17:48.932972Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.932972Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:490ba4eba080f0c30dcae07b17d3da4dcb1e9fe0a125d502fa092f58b5335523","observation_id":"6af88e4b-0463-4587-9adb-a98e97fcb927","resolution":{"observed_at":"2026-08-11T11:17:48.932972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-08-15T21:55:47.604051Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-11T11:17:48.938143Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.938143Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:396a9464bda46171b0130bd5e004fefb1bdad576842d508e5e25541f011aae7e","observation_id":"12f2a6eb-f3da-48a6-814c-2d6b4a329066","resolution":{"observed_at":"2026-08-11T11:17:48.938143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:48.943269Z","title":"G.; Guo, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.943269Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:7c5ec100f42de436a0e9d39c5a68ab115109105749dd59f4d6681b79cbd16957","observation_id":"5628e92e-457a-4afb-a72f-f78b17f5a140","resolution":{"observed_at":"2026-08-11T11:17:48.943269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T11:17:48.948353Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.948353Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:fc72ac4a7619f18bfb7d7af04701a1464ce879d6971299be77b009c29d453b71","observation_id":"2acfd132-0dc6-4439-93ae-e98856297630","resolution":{"observed_at":"2026-08-11T11:17:48.948353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-11T11:17:48.953494Z","title":"A.; Adeli, E.; Altman, R.; Arora, S.; von Arx, S.; Bernstein, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.953494Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:5bd013dd42f44d29b1ef494093123bb72397c5a213ae2ba3a2c10ab2b4868ec1","observation_id":"168bfd0a-316d-4120-8615-4698b20260c2","resolution":{"observed_at":"2026-08-11T11:17:48.953494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.698345Z","title":"A.; and Terry, M","venue":null,"work_id":"8c56c72e-edd6-437b-b8a9-26388244ae8b","year":1952},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.958936Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:849de3d9114443bb4efb02110c4c1f54ce13146461b94cc87bd3e5db75d6b6d6","observation_id":"238f35a9-ef22-4939-b519-220aec9528ec","resolution":{"observed_at":"2026-08-11T11:17:49.702454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-11T11:17:48.963693Z","title":"J.; and Wong, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.963693Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:e393cca656fb42c91f0aef40bf59247c51499ad2915400fe80bbd1c40cea5986","observation_id":"aac5db27-5d32-468f-8b23-b5d8209259b5","resolution":{"observed_at":"2026-08-11T11:17:48.963693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.686332Z","title":null,"venue":null,"work_id":"b6e52fed-9e74-4507-a43e-8fa340fcff50","year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.969079Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:b39f081793f706ad7ad743ae5c13e3e5e22a343915ae262dfed903ff20b43445","observation_id":"469e2278-cd99-4339-b0e1-c1d0e748ed52","resolution":{"observed_at":"2026-08-11T11:17:49.690333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-08-16T14:53:31.129213Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-08-11T11:17:48.973813Z","title":"J.; and Bing, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.973813Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:14bcec76cfabe29e6626d21eed3b6343c5840bcbcc47cb6b22e9ec1da1a4663c","observation_id":"728c2b89-3e74-416b-8fa6-cbac83fce0f3","resolution":{"observed_at":"2026-08-11T11:17:48.973813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-11T11:17:48.979129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.979129Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:434229a2e61a927d95e1a5375147126df8c129edc898d2b50423b484d2e4f7f7","observation_id":"5865d1d9-33db-4f74-a8c9-2a169c4fbcee","resolution":{"observed_at":"2026-08-11T11:17:48.979129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.674054Z","title":"A.; Matar, N.; Sowan, B.; Al Khaldy, M.; and Barham, H","venue":null,"work_id":"a853e9e0-d867-4244-a69b-5aa21f5a0fb2","year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.984219Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:5f67ba3f9e2f82edae640c0bc0d3d1cfd3414528c355e9f61ec11cb3e17b0c1c","observation_id":"a6801a13-e451-4995-91f1-611a40a04a97","resolution":{"observed_at":"2026-08-11T11:17:49.679038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.662905Z","title":null,"venue":null,"work_id":"e60ce53b-8ebe-42ce-94af-836cd8d06388","year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.988512Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:72a8394431030fba328bca47f242e26d3ad84b40f26390665e8ffdec29fd8b6c","observation_id":"42b34650-d4e8-4019-a009-6fc9e15caba8","resolution":{"observed_at":"2026-08-11T11:17:49.666583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-11T11:17:48.992980Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.992980Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:422ea34db41bc2f9d16d86e673f53e435bce18be77b4f5407066e94a235d5be0","observation_id":"e877a6fc-77ba-44a0-8685-0b97b9679712","resolution":{"observed_at":"2026-08-11T11:17:48.992980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-11T11:17:48.997434Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:48.997434Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:aa0ae080c3e3b154861cee048ec79e3a66debeec80d3f358a0abe6807c5677cf","observation_id":"24ebf4fe-5310-4ecc-a900-d493c13b42e1","resolution":{"observed_at":"2026-08-11T11:17:48.997434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-11T11:17:49.002361Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.002361Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:88099e344cf6f30e7545b3644866ae8504a12b03a259be843bdb24eb579ee0c1","observation_id":"fc0e9486-c296-420f-8cec-e4bce0a2f699","resolution":{"observed_at":"2026-08-11T11:17:49.002361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.651917Z","title":null,"venue":null,"work_id":"198016c3-38fa-40f2-a94b-ed367bb7d7e4","year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.006880Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:5b2dc2416cf9d9acbf8fae02f9fbb70128394a338dd59e8c0c51e131fcdd18ce","observation_id":"0557ef9e-4c06-4bf8-9bc8-2687cd2009fc","resolution":{"observed_at":"2026-08-11T11:17:49.655666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05197","last_updated":"2023-11-01T05:14:01Z","snapshot_observed_at":"2026-08-17T06:15:40.082119Z","submitted_at":"2023-04-11T13:05:04Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05197","snapshot_observed_at":"2026-08-11T11:17:49.011649Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.011649Z"},"links":{"cited_paper":"/paper/2304.05197","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:62efac59bae25bc89dfe541bec1b6ed4c80abe840b5ad106bd3529b02e98cb39","observation_id":"c03a3bdc-2396-42e6-a34d-6ab8f9af59d4","resolution":{"observed_at":"2026-08-11T11:17:49.011649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-18T06:50:23.685098Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-11T11:17:49.016707Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.016707Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:c3c7fc10dd595b8d1a2645d63aa626fd8ac1e1e2215cbc0ef12b7096576ed6e8","observation_id":"824633dc-76df-4737-ac19-52cdbd47e167","resolution":{"observed_at":"2026-08-11T11:17:49.016707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.641098Z","title":null,"venue":null,"work_id":"25f5e4c2-8150-4969-a78d-5d936a76b7e5","year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.022641Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:17d66623d6fd8b6531d49694b27abcf079f0aa92568a52bf8269856711538d5c","observation_id":"0392e662-461c-41e5-bbe9-a5b16b01306f","resolution":{"observed_at":"2026-08-11T11:17:49.644753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13860","last_updated":"2024-03-10T13:58:08Z","snapshot_observed_at":"2026-07-06T15:31:18.144952Z","submitted_at":"2023-05-23T09:33:38Z","title":"Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13860","snapshot_observed_at":"2026-08-11T11:17:49.027329Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.027329Z"},"links":{"cited_paper":"/paper/2305.13860","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:08750deb7aba6a15210e5ba4fb04dbeed2f7ad95da234d3ca40c0bc0334ef2c1","observation_id":"9293c9b8-8dee-47e2-9b81-0a3d9ae76639","resolution":{"observed_at":"2026-08-11T11:17:49.027329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T11:17:49.032269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.032269Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:9506955a33254f8627f5f27c03dfa2c7d650fa6f83e32a016bd3e5504a8a8bea","observation_id":"7e34296a-7701-469c-a51c-ec0dffb8eec0","resolution":{"observed_at":"2026-08-11T11:17:49.032269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.037916Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.037916Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:33fca14d66b91dd211bfd4066545c1bd21cbe7f40e9838fe71b067b8a8381519","observation_id":"01b7bb61-1a87-4d64-a81d-178a395017dc","resolution":{"observed_at":"2026-08-11T11:17:49.037916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-11T11:17:49.043581Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.043581Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:65375e7ae4da42bb4a1d0105a10ad54b17dc964732613dde29f7df63a3e17faf","observation_id":"0f58b3d2-fce9-49ad-b22e-fbb22562a0aa","resolution":{"observed_at":"2026-08-11T11:17:49.043581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.622643Z","title":null,"venue":null,"work_id":"0e83eef4-53af-49fe-8c98-18aa5fba1f70","year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.048142Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:326ed25499fc68266e9ce55262c878975ea296b4a878601d504a45ceb1f701f0","observation_id":"78dacdc9-dbe9-4076-8d02-912a023e24ca","resolution":{"observed_at":"2026-08-11T11:17:49.626497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.052422Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.052422Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:4373d0c9e27e7b92b9f7ba80e0422a6b00e049e72dee80be4bc90622c2d6aab1","observation_id":"9803a7e5-5749-453b-bc7c-098d46ebf5bf","resolution":{"observed_at":"2026-08-11T11:17:49.052422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.603585Z","title":null,"venue":null,"work_id":"633ce91c-0d50-45b6-a4a5-9a511b4ef8aa","year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.056580Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:625ba504a48bff6e3f7e94517ccae864e79b8d4e56c18a7b7af6a149405edad3","observation_id":"8e748bb9-50f7-42ba-8c86-6d59fd1dd289","resolution":{"observed_at":"2026-08-11T11:17:49.607845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-08-17T16:09:43.865191Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-11T11:17:49.061766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.061766Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:fbc72574c28f2c15f7581836b9f13f142d5d72733cde163ecdae63cb6d39da9d","observation_id":"eb2dddc6-044a-4eee-a744-3e8134cf1f41","resolution":{"observed_at":"2026-08-11T11:17:49.061766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T11:17:49.069826Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.069826Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:5a4a7e64737cee2c3cf1917a44263a89f5d01eab82e391604e9493f8a77a62cb","observation_id":"6245f067-4c2b-4693-89de-9ae3a6ff5ba4","resolution":{"observed_at":"2026-08-11T11:17:49.069826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-16T15:13:42.128297Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-11T11:17:49.074644Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.074644Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:c36817e055642e859d393ff6252b4a639362598e10bf670c492fe750c6420fa0","observation_id":"f4e4fe56-7535-424b-b328-10d7df17daf0","resolution":{"observed_at":"2026-08-11T11:17:49.074644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.592792Z","title":null,"venue":null,"work_id":"1df7266e-04bf-4249-a1aa-ceb9d4096e19","year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.079154Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:a8bb4f00d69ccc228480d5cf8b1efaf6e7c7ba0849137b21a3ddd5c22221824a","observation_id":"4d49c7c0-02b0-416a-a604-9eb4492650b8","resolution":{"observed_at":"2026-08-11T11:17:49.596508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.582267Z","title":null,"venue":null,"work_id":"1388eb19-1110-4e9d-bd06-c8bde0cef564","year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.083712Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:dabdcd34307fedc6763b501661148dff93d8923571793125af2997a8346c0996","observation_id":"a36afdaf-8631-403f-b79d-4c01ef20fcce","resolution":{"observed_at":"2026-08-11T11:17:49.585887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09827","last_updated":"2024-02-29T08:20:07Z","snapshot_observed_at":"2026-08-16T14:42:42.652229Z","submitted_at":"2023-11-16T11:52:22Z","title":"Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09827","snapshot_observed_at":"2026-08-11T11:17:49.088485Z","title":"Z.; Xiao, C.; and Chen, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.088485Z"},"links":{"cited_paper":"/paper/2311.09827","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:19c8ea2ab42cbc9bcd25cc4f7d1cfada4315411111bc57a442ba00a0b56fe647","observation_id":"bbb33e81-3881-47da-af11-20f837f38f5d","resolution":{"observed_at":"2026-08-11T11:17:49.088485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13457","last_updated":"2024-05-17T05:00:24Z","snapshot_observed_at":"2026-08-16T14:16:46.139055Z","submitted_at":"2024-02-21T01:26:39Z","title":"A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13457","snapshot_observed_at":"2026-08-11T11:17:49.093000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.093000Z"},"links":{"cited_paper":"/paper/2402.13457","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:659c12762553e5081a2d84eb58ab92fa397e5fa0dee183084fcc4ac347f99966","observation_id":"fb530ff6-8e8f-44cf-a7f8-d49f313fa476","resolution":{"observed_at":"2026-08-11T11:17:49.093000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.097099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.097099Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:361027fda877ad5086d04e6fdffcb26bb093b809b2e0e74ffea6c382190927e6","observation_id":"916a2252-3f75-4f40-a54e-6a8d0050f7c2","resolution":{"observed_at":"2026-08-11T11:17:49.097099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.564010Z","title":null,"venue":null,"work_id":"a02a6084-3b03-45c2-8f77-4ee8ad7dbb9e","year":2024},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.101446Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:a5985f402a1e82b70d0d1bf6d4537a6f0c1f7ae0db79e9576716cbbf2b08fdf3","observation_id":"d71b151d-cb61-47b7-81fb-bf21d2acfc46","resolution":{"observed_at":"2026-08-11T11:17:49.568554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-08-13T01:25:06.346704Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-11T11:17:49.105339Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.105339Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:6b44a6c9e3061f7a58d10a3436e8c60c7d974b50561c37bb0c76e60d6f47dff9","observation_id":"4a5f5dfe-42d3-458a-9933-33c402fa66f5","resolution":{"observed_at":"2026-08-11T11:17:49.105339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-11T11:17:49.109167Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.109167Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:f50f1f488258d7a6c99621c6de78625d7403a44f925b7a04bbdfbe4bb6ed0689","observation_id":"560d5cea-4212-4f18-9b72-ced4d181817e","resolution":{"observed_at":"2026-08-11T11:17:49.109167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-08-16T15:08:58.773796Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-11T11:17:49.113067Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.113067Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:35ff213bb8f5b70001a9dd33cf73a4f5493ff297edd678fff6f472435c4d1358","observation_id":"137eadbd-56b4-4846-a67d-8e4022145685","resolution":{"observed_at":"2026-08-11T11:17:49.113067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00286","last_updated":"2023-12-10T13:58:24Z","snapshot_observed_at":"2026-08-18T10:08:35.100624Z","submitted_at":"2023-11-01T04:36:45Z","title":"JADE: A Linguistics-based Safety Evaluation Platform for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00286","snapshot_observed_at":"2026-08-11T11:17:49.117092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.117092Z"},"links":{"cited_paper":"/paper/2311.00286","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:888f7b2aefafde7f428ccc4f75b5bb224def2f28f7016101411bd39695283fb1","observation_id":"ba866eeb-24be-4a4f-ad06-002dc1a6d468","resolution":{"observed_at":"2026-08-11T11:17:49.117092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-11T11:17:49.121982Z","title":"Z.; and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.121982Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:dcec62923e7efd1fb073773b27f465d639648754dba0e501b80fa06ccad2b9d9","observation_id":"d0a73ea6-7be6-4e3f-9b3c-79e9c34d6bbc","resolution":{"observed_at":"2026-08-11T11:17:49.121982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.126570Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.126570Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:1ffdd8c80e5955ed5ec342010a687215052a773189f00f795ac131932743c4da","observation_id":"004e798d-c51f-4a46-8c99-fd46fe2f21c1","resolution":{"observed_at":"2026-08-11T11:17:49.126570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:17:49.131015Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T11:17:49.131015Z"},"links":{"citing_paper":"/paper/2412.15623"},"observation_digest":"sha256:ab116618f574e16d099d5dcf6c6576cbec2a41d3ec39f34d3006d8839c90252c","observation_id":"7738d14f-ae98-41a4-87c8-f2e914c06812","resolution":{"observed_at":"2026-08-11T11:17:49.131015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 3 inbound Pith citation observations for arXiv:2412.15623."}