{"as_of":"2026-08-19T12:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6df2a847e335e54e370a08b551776e04016d61c0bb0ed10fedbb871dfeea2325","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:21:58.997491Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06338/citation-record","integrity":"/paper/2509.06338/integrity","json":"/paper/2509.06338/citation-record.json","paper":"/paper/2509.06338"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:00.032191Z","title":null,"venue":null,"work_id":"43ca59b3-3531-4ae7-a677-66ce472fecb0","year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.723129Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:c0c9a7144cfc036f5891401b74b34ad9b1c9058ee03bfdbffca1d42dc61287ab","observation_id":"c0c05eef-9022-48b9-bc81-2be2ba0ad8d5","resolution":{"observed_at":"2026-08-15T16:22:00.037107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-18T08:23:26.325897Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-15T16:21:58.728709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.728709Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:064a7520acfb32d55997fed7c92381bc0174c32d4428d9635b9a7ac3ed1df816","observation_id":"6ef95d3b-167c-42da-b9bd-cc6829dec31a","resolution":{"observed_at":"2026-08-15T16:21:58.728709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-17T07:39:23.832733Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-15T16:21:58.734558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.734558Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:789c98e0ecf2e150dfd2c5dcc17cd7f65e9096d9311d7062d960d121385dbfb4","observation_id":"0476618d-1137-4ef8-bbec-acaaf3cbbfff","resolution":{"observed_at":"2026-08-15T16:21:58.734558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:58.739712Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.739712Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:0b72fb5350c20d0dc8e249c9891261af19ecbcdde0509763f83d4f909e250714","observation_id":"007f57b3-905f-4231-93e3-a9829da3619a","resolution":{"observed_at":"2026-08-15T16:21:58.739712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-08-16T15:00:38.570579Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-08-15T16:21:58.749481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.749481Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:b3b1c7e861ff74026f0c970f39b42f45aafb9e34c2bb81c825282a44d6d64b59","observation_id":"4c16cb58-1c18-4637-814f-655aa845de18","resolution":{"observed_at":"2026-08-15T16:21:58.749481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:00.006981Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift Conference’17, July 2017, Washington, DC, USA Pappas, Florian Tramèr, Hamed Hassani, and Eric Wong","venue":null,"work_id":"84c1c321-95bd-4b23-8293-dca66a401b96","year":2017},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.754910Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:7745930ec0405766f887c81dd0efced14e888ab80bb8e170f70c90107f8f73b1","observation_id":"a6051bc4-d415-4630-a8a8-6d1264b3241d","resolution":{"observed_at":"2026-08-15T16:22:00.012051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-15T16:21:58.759970Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.759970Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:71e30506b38b1c2a10e2aa19fef79b57fe690e504a20ccf7c1881f3934ce38d8","observation_id":"de473e3f-301b-42e0-a2de-80074899320d","resolution":{"observed_at":"2026-08-15T16:21:58.759970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T16:21:58.765160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.765160Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:6262e020c87a22ab38be07c352371d7c97753bd05f9b2225b8b846b3f8ed42ad","observation_id":"3a1fa6dd-89a4-4691-840b-fd0d08cafc5e","resolution":{"observed_at":"2026-08-15T16:21:58.765160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18137","last_updated":"2024-11-04T11:16:38Z","snapshot_observed_at":"2026-08-18T23:48:19.984090Z","submitted_at":"2024-05-28T12:51:01Z","title":"Exploiting LLM Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18137","snapshot_observed_at":"2026-08-15T16:21:58.770502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.770502Z"},"links":{"cited_paper":"/paper/2405.18137","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:3812db7b3406c635e4e06cb682b72152bf53503cf423678000a82ffd68bbc99e","observation_id":"412d3b52-7cfc-40dd-bdde-b38298ed82c0","resolution":{"observed_at":"2026-08-15T16:21:58.770502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01547","last_updated":"2024-12-02T14:35:43Z","snapshot_observed_at":"2026-08-18T02:30:33.868485Z","submitted_at":"2024-12-02T14:35:43Z","title":"Improved Large Language Model Jailbreak Detection via Pretrained Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01547","snapshot_observed_at":"2026-08-15T16:21:58.775054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.775054Z"},"links":{"cited_paper":"/paper/2412.01547","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:0f2c365867b24948a94e4241b97890edf1f02ed3f649e7e5e15099dd56ed7154","observation_id":"f6b8fbfe-074b-4a14-bc40-02564e602db2","resolution":{"observed_at":"2026-08-15T16:21:58.775054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.03180","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.716885Z","title":"Sah, and Fathi Am- saad","venue":null,"work_id":"fb71439f-4f4b-4831-89b5-4e12bb87bed9","year":2025},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.780267Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:0aaa598c645a9b042a5cc1055049b3a597ed3cb1b9848da23c0e21d74560b68c","observation_id":"4c91ebf5-5df8-4145-a9c1-4db7efab60e4","resolution":{"observed_at":"2026-08-15T16:21:59.724359Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-08-16T14:18:53.099186Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-15T16:21:58.790091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.790091Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:06dc44017840f80c6a24ac6aeb9c4021ec768422f9beaac1af0525751eb652a2","observation_id":"21c3e0e8-c25d-43cd-992c-c96839172633","resolution":{"observed_at":"2026-08-15T16:21:58.790091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16497","last_updated":"2025-01-27T20:57:26Z","snapshot_observed_at":"2026-08-17T20:21:25.789773Z","submitted_at":"2025-01-27T20:57:26Z","title":"Smoothed Embeddings for Robust Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16497","snapshot_observed_at":"2026-08-15T16:21:58.795021Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.795021Z"},"links":{"cited_paper":"/paper/2501.16497","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:81eceb1713d1e4fad01f74d4ae5a2c44b43221943e41b6d78611eb172d2b0d3e","observation_id":"a4037bb0-48ea-40e9-9565-1e8456f2da7a","resolution":{"observed_at":"2026-08-15T16:21:58.795021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01604","last_updated":"2024-11-03T15:20:21Z","snapshot_observed_at":"2026-08-19T03:06:34.180755Z","submitted_at":"2024-11-03T15:20:21Z","title":"Large Language Model Supply Chain: Open Problems From the Security Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01604","snapshot_observed_at":"2026-08-15T16:21:58.799851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.799851Z"},"links":{"cited_paper":"/paper/2411.01604","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:4d98e60f6b1a53e3338c96fc2f04eb7ba4d14733241b59c35f5926c2b39151fa","observation_id":"91e254e3-1138-4adc-b695-2056d4002ac1","resolution":{"observed_at":"2026-08-15T16:21:58.799851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:58.804727Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.804727Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:490a1dde806c64ab68398c3e899d72f0c5f3ca8798789e229f6edebf9cc34eca","observation_id":"645c7d78-d786-4a06-aedc-f6852660446c","resolution":{"observed_at":"2026-08-15T16:21:58.804727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-15T16:21:58.815294Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.815294Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:360d4e3c9c795494adcefe6cca8f8cedd3682da8cca3ae4ebb670525dfd0498b","observation_id":"9bd0a1b7-d4dd-4971-bf98-d8f32c2881e0","resolution":{"observed_at":"2026-08-15T16:21:58.815294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-15T16:21:58.819852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.819852Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:5225a1cbeee0c201db838622e957f86d66cc49635ba401e3ef7e27aa03298bd2","observation_id":"afef8dbc-a808-4655-b771-164f40d105b6","resolution":{"observed_at":"2026-08-15T16:21:58.819852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.981541Z","title":null,"venue":null,"work_id":"c0dabd46-7a11-4ab7-9c82-9954f151fa4a","year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.824746Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:476e256a311cbc3f623397877d4b2cbef3b41c102c6612b95329fcefc97d627b","observation_id":"5705883a-3555-4e6c-8ef4-f5d491cc574a","resolution":{"observed_at":"2026-08-15T16:21:59.986094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-16T01:57:57.079327Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13068","snapshot_observed_at":"2026-08-15T16:21:58.835860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.835860Z"},"links":{"cited_paper":"/paper/2405.13068","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:4369ff83a0abe6bc6be81f9bc8b661ef230c802c2b3a8fdf9546dea9b0518580","observation_id":"0acb6bc5-0617-43f9-bc2c-0db8dbb3d004","resolution":{"observed_at":"2026-08-15T16:21:58.835860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:58.841537Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.841537Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:4607b4b38c65658c5c2e5e06bbeb0b6b969a84b8a7b46f812206a51df6b53868","observation_id":"33adecd4-26ea-48d7-8ba7-c3e5aa51a594","resolution":{"observed_at":"2026-08-15T16:21:58.841537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-15T16:21:58.852566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.852566Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:8f28cd60a68513a84d43318b784c6139cfdc51535414fc9d0f809e7642ac0b58","observation_id":"7bcb2cb5-11ab-4f37-bcfe-5a802068d797","resolution":{"observed_at":"2026-08-15T16:21:58.852566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T16:21:58.857698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.857698Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:dcbfa7f4c31517d5115c0d8fb19602b66d50ef61432b3c6261d74d29f513da1d","observation_id":"c57b97dc-2c7d-41cc-9fa5-5ff5f8a1e86d","resolution":{"observed_at":"2026-08-15T16:21:58.857698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-15T16:21:58.863345Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.863345Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:e8e564a390786a156039a95af0c8feb7c9e0e4d1da8b40fd1c52527235894d19","observation_id":"1badeca7-5c3a-4086-a07d-8f972f185b85","resolution":{"observed_at":"2026-08-15T16:21:58.863345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-15T16:21:58.868744Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.868744Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:a7ce9f02fbb91238c0987fc02f36ff1807022df37766157a2b5c1d1e0e3019f3","observation_id":"8c0fa113-6fd8-4fec-adaf-dbaa844fbbdd","resolution":{"observed_at":"2026-08-15T16:21:58.868744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-15T16:21:58.873890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.873890Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:44225295a6086081bab9e40e763666edef727a5f1f21b8c34c5f4b6cbc493081","observation_id":"dd95d0fa-b4cd-4204-9979-67abe94b847e","resolution":{"observed_at":"2026-08-15T16:21:58.873890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-15T16:21:58.879102Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.879102Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:2c28b288884a75d986888ca0034a5cffe1fb17dd23c9f5daf486b27a53321daf","observation_id":"524ab78b-ec1a-42cd-9647-33b2f93548f0","resolution":{"observed_at":"2026-08-15T16:21:58.879102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-08-17T15:25:03.596568Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-15T16:21:58.884367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.884367Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:b19f19c0061b6cb30654b920ea002e72605282e43ffff5a2a51548aee263999b","observation_id":"046dffd4-09e0-4616-a220-e0e89254513e","resolution":{"observed_at":"2026-08-15T16:21:58.884367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:58.889610Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.889610Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:c1add52439dcb25ba65a494bff2d563a320a92822bf0cb10ec6b1e452453bb86","observation_id":"f00a2928-b60b-4059-8a47-3cf891666862","resolution":{"observed_at":"2026-08-15T16:21:58.889610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19737","last_updated":"2023-10-30T17:01:02Z","snapshot_observed_at":"2026-08-17T04:16:32.392084Z","submitted_at":"2023-10-30T17:01:02Z","title":"Adversarial Attacks and Defenses in Large Language Models: Old and New Threats","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19737","snapshot_observed_at":"2026-08-15T16:21:58.899446Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.899446Z"},"links":{"cited_paper":"/paper/2310.19737","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:4288961e623339f0d20a6b303affdf12a16bce48392024259393cecb17abbaa1","observation_id":"2fb63d71-039d-43af-8ba0-f4c1c92cc05c","resolution":{"observed_at":"2026-08-15T16:21:58.899446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09063","last_updated":"2025-04-16T15:15:56Z","snapshot_observed_at":"2026-08-19T03:17:45.396518Z","submitted_at":"2024-02-14T10:20:03Z","title":"Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09063","snapshot_observed_at":"2026-08-15T16:21:58.905172Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.905172Z"},"links":{"cited_paper":"/paper/2402.09063","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:38202473efc1eddbdd02b0db97dc3804b17762b145245f595d892087816a1993","observation_id":"4a90ab51-7588-49ee-bb68-757c5ce8b108","resolution":{"observed_at":"2026-08-15T16:21:58.905172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13138","last_updated":"2022-12-26T14:28:24Z","snapshot_observed_at":"2026-08-18T17:55:17.693956Z","submitted_at":"2022-12-26T14:28:24Z","title":"Large Language Models Encode Clinical Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13138","snapshot_observed_at":"2026-08-15T16:21:58.910428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.910428Z"},"links":{"cited_paper":"/paper/2212.13138","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:d99857cc7d9e348f66d289ff2eef423cbfe3aeed3a460630faa0e9c56a1d11a6","observation_id":"61f5cc48-e92e-41a7-98fd-cd43789d5a55","resolution":{"observed_at":"2026-08-15T16:21:58.910428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-15T16:21:58.915363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.915363Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:16df93edbf9a919ce27d74300db3f69ea24e44e8a016471acdbd87e0c5e7116b","observation_id":"f0af96e4-467b-472e-b8a7-fea8f4cfceae","resolution":{"observed_at":"2026-08-15T16:21:58.915363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T16:21:58.920460Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.920460Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:d1ce6020bef33bc4ddb8b4ab9b59dd46efa4748bf3facd9396d804c37dfe9018","observation_id":"636da4fb-a1e8-44fc-be6e-3d4a58a60e30","resolution":{"observed_at":"2026-08-15T16:21:58.920460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16006","last_updated":"2024-06-04T02:59:58Z","snapshot_observed_at":"2026-08-16T14:15:35.514584Z","submitted_at":"2024-02-25T06:46:27Z","title":"ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16006","snapshot_observed_at":"2026-08-15T16:21:58.925426Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.925426Z"},"links":{"cited_paper":"/paper/2402.16006","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:d2cf792217b190045a72ab5b6925e9e455ea5f43271ef952bec50b77c127c2ea","observation_id":"4430dee8-9501-403c-9da4-dc6a2721bfdc","resolution":{"observed_at":"2026-08-15T16:21:58.925426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15589","last_updated":"2024-11-01T16:39:36Z","snapshot_observed_at":"2026-08-16T13:49:43.562561Z","submitted_at":"2024-05-24T14:20:09Z","title":"Efficient Adversarial Training in LLMs with Continuous Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15589","snapshot_observed_at":"2026-08-15T16:21:58.931041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.931041Z"},"links":{"cited_paper":"/paper/2405.15589","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:7bc01d0eb565f87dad3cc0f30836667b2302a1a11229de757ea7506b4133ea6c","observation_id":"dc27c8e0-f3ea-4bb1-b032-a3853e8a88c3","resolution":{"observed_at":"2026-08-15T16:21:58.931041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13796","last_updated":"2024-07-16T20:53:00Z","snapshot_observed_at":"2026-08-16T13:33:36.947875Z","submitted_at":"2024-07-16T20:53:00Z","title":"Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13796","snapshot_observed_at":"2026-08-15T16:21:58.936322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.936322Z"},"links":{"cited_paper":"/paper/2407.13796","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:dd8adc63390de800a8eb846cec9e81ab1dc42937fc5be53f4f0f92e32851da86","observation_id":"e240e770-5338-499e-848f-3d75150583eb","resolution":{"observed_at":"2026-08-15T16:21:58.936322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T16:21:58.941564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.941564Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:69330d965ca315a3386608526927dcb41fcb886dd9a9bdd73a818ac8827cdc0f","observation_id":"9852238c-7794-4406-9ff0-4cb83cbbe2dd","resolution":{"observed_at":"2026-08-15T16:21:58.941564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-15T16:21:58.946206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.946206Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:722cd446e448739adea9959e1d6aba0fecb104fed34beeb2ef2c276af11dab0d","observation_id":"94a67477-6cb5-446d-9ff7-192b91c29983","resolution":{"observed_at":"2026-08-15T16:21:58.946206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-18T10:24:13.017257Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-15T16:21:58.950836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.950836Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:3d79421ca47bd792054722fb94ba01a37dafbc36d41d19bfd57fbe152bb5e9e2","observation_id":"2f46b1c3-f228-4b2d-b67f-0d8c055eba2c","resolution":{"observed_at":"2026-08-15T16:21:58.950836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.930344Z","title":null,"venue":null,"work_id":"a1002188-7ae7-4136-a812-89a5b5504516","year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.955863Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:cffc040906d8547cc2face39aee886370e15531d151de0e760ea7d4496b93e81","observation_id":"bfbf7cbd-5c61-4316-9acf-37ac60dd11fa","resolution":{"observed_at":"2026-08-15T16:21:59.934929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-08-16T15:08:58.773796Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-15T16:21:58.960568Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.960568Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:4bfd155def14bcafc91bd6571139dde99ae2c8ea868576196d5cec00949b84c0","observation_id":"0ad7cd4e-8ace-4db5-9746-3cd4c5e513c3","resolution":{"observed_at":"2026-08-15T16:21:58.960568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03644","last_updated":"2024-12-04T14:27:06Z","snapshot_observed_at":"2026-08-18T10:36:38.427675Z","submitted_at":"2024-05-06T17:07:28Z","title":"When LLMs Meet Cybersecurity: A Systematic Literature Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03644","snapshot_observed_at":"2026-08-15T16:21:58.966681Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.966681Z"},"links":{"cited_paper":"/paper/2405.03644","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:23ea9e972683b9d11d1cc3ecfa1e90fe7946acc3c95bef7012f14fe06c1dc1d2","observation_id":"2186f8c6-612a-4134-8225-1f0e9e65fb46","resolution":{"observed_at":"2026-08-15T16:21:58.966681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.913862Z","title":null,"venue":null,"work_id":"495c5b19-3300-465d-92c8-8e3ccd16ad71","year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.972117Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:e3e7ad55d221fe91154ddc86916c01eac233e8902229d8ccba3b2ed463d7ae67","observation_id":"2bdf2999-273e-4b66-8dbc-9e9a418ae49b","resolution":{"observed_at":"2026-08-15T16:21:59.919358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.898597Z","title":null,"venue":null,"work_id":"cf02ebbe-7638-4e5f-9c5e-053a5247c62a","year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.982439Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:f57ca2a8ebc6dddfb3ca6c677ff706c23ccc8ef0588d38690f54b0d47178ddbe","observation_id":"4a91b5d8-f775-43d0-8c57-2fc15066ee54","resolution":{"observed_at":"2026-08-15T16:21:59.903359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-15T16:21:58.987023Z","title":"danger\":","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.987023Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:39c222dcd36254ad77367f878eb06e4e339fcbaa9660e9d56ea81c14281dd595","observation_id":"ee540167-276e-488f-a6ff-d4a80eda6928","resolution":{"observed_at":"2026-08-15T16:21:58.987023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-16T11:53:02.284922Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"cited_work":{"arxiv_id":"2507.08020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.08020","snapshot_observed_at":"2026-08-15T16:21:59.052888Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","venue":"cs.CL","work_id":"df9ed101-2277-434c-9dc8-232e5574b11a","year":2025},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.977344Z"},"links":{"cited_paper":"/paper/2507.08020","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:9afc1b8843f23b262372cd3338d1eb2854a7ad73cb188f43880823d82806265c","observation_id":"ede4037f-2d00-42b9-9c57-b72ef58b76c2","resolution":{"observed_at":"2026-08-15T16:21:59.060395Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.882257Z","title":null,"venue":null,"work_id":"b6c64d8b-e47d-4b37-bf03-cc1b7a461e0a","year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.992563Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:0f6e42675a2071a4ba6e0cf9e7497af4d54c290a53688fc10d2e4a3e623166f3","observation_id":"0cc4207a-4537-4eec-bd17-af25c1db5170","resolution":{"observed_at":"2026-08-15T16:21:59.887498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.865864Z","title":null,"venue":null,"work_id":"1e3431fa-0624-445b-9322-3e0dd5c05011","year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.997491Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:1adb010c9b883c8dfe358fd97a34a1d571792eb2eaa0e90acd0518c54409f28c","observation_id":"a189e524-5468-427c-87ef-59ad64fc4bbd","resolution":{"observed_at":"2026-08-15T16:21:59.870957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T16:21:58.894896Z","title":"arXiv:1707.06347 [cs.LG] https: //arxiv.org/abs/1707.06347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.894896Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:5a40fa29d053f6ed8c39cd3d97db929a8286d4e406ae9fd302ad0a203fce2a5e","observation_id":"66c05a01-f4fc-4b42-8bba-7a527f1e643a","resolution":{"observed_at":"2026-08-15T16:21:58.894896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T16:21:58.744497Z","title":"arXiv:2204.05862 [cs.CL] https://arxiv.org/abs/2204.05862","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.744497Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:7f0f2dc6d0a00d6223fdecd97d7f69de14f71bca8ec434f33cd17a515636da26","observation_id":"997b0497-70c9-4b3f-b9f1-d6a0762563d2","resolution":{"observed_at":"2026-08-15T16:21:58.744497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:58.831047Z","title":"Learning and Individual Differences 103 (2023), 102274","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.831047Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:6b5e2d9b1a92d281be86c92235eca33d9c292d46d251c1321d83e9e9b1312edf","observation_id":"2cd75bbd-5814-4d9d-bbfe-cba8fde30a34","resolution":{"observed_at":"2026-08-15T16:21:58.831047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:21:59.956186Z","title":"In 33rd USENIX Security Symposium (USENIX Security 24)","venue":null,"work_id":"ca682285-d831-4191-b07d-19f8f2440dfd","year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.846667Z"},"links":{"citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:2a52ab2bcbc09613c914604d99bc9adb622a0f5fe3199209b607c994053825ad","observation_id":"eadeae49-a81d-4dfd-9824-cf9d34b01915","resolution":{"observed_at":"2026-08-15T16:21:59.960931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17433","last_updated":"2025-01-29T06:24:58Z","snapshot_observed_at":"2026-08-16T12:58:26.918057Z","submitted_at":"2025-01-29T06:24:58Z","title":"Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17433","snapshot_observed_at":"2026-08-15T16:21:58.809851Z","title":"arXiv:2501.17433 [cs.CR] https://arxiv.org/abs/2501.17433","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T16:21:58.809851Z"},"links":{"cited_paper":"/paper/2501.17433","citing_paper":"/paper/2509.06338"},"observation_digest":"sha256:45be1cd4dcbf3faf5515480659a51c79b157636961a74ecc70d0d6c18b2f70f4","observation_id":"5624a3d0-8089-4952-b44e-5374228ece23","resolution":{"observed_at":"2026-08-15T16:21:58.809851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06338","last_updated":"2025-09-08T05:00:58Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-19T04:52:07.684642Z","submitted_at":"2025-09-08T05:00:58Z","title":"Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2509.06338."}