{"as_of":"2026-08-07T07:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18c99a6f5796bd7dbdfc7145db7d46132ac511ad9bd0f202da5058753cb6dbc1","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:26:13.782513Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08020/citation-record","integrity":"/paper/2507.08020/integrity","json":"/paper/2507.08020/citation-record.json","paper":"/paper/2507.08020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.240046Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.240046Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:2b5d3113547a9698b79ce018f86f744dfed42c9c9ede649342a3060852f41a24","observation_id":"e65c18f2-faa2-4d3d-b5b0-2b7092dfa637","resolution":{"observed_at":"2026-08-06T19:26:13.240046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.325795Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.325795Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:d6ae2e066af4398f7315b53b3caf4b353218973f20420d103c88ee6ab16232b6","observation_id":"7a202d84-0c97-4bb1-b685-2d4d6adbcab1","resolution":{"observed_at":"2026-08-06T19:26:13.325795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T19:26:13.448232Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.448232Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:7694a5980fc1fb66680775da4ca464d39406c9265eb768d9125ff884e9946259","observation_id":"444107dd-de74-4159-b95b-a670c2478fb7","resolution":{"observed_at":"2026-08-06T19:26:13.448232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.764419Z","title":null,"venue":null,"work_id":"16770189-d225-4b60-a2c2-8c244ad8c135","year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.560615Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:f326ce5e31ad3294cb92749a8c43bf6f6f764ff14b79637537d4075fa8e38c91","observation_id":"88d6aace-017c-430c-9f67-184932d69a17","resolution":{"observed_at":"2026-08-06T19:26:14.767093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T19:26:13.617300Z","title":"Hudson, Ehsan Adeli, Russ Altman, Simran Arora, Sydney von Arx, Michael S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.617300Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:f477dfbadbbd73b757c572c1843a7e20c9b2acb54ce968375b5625b9e1d0eecc","observation_id":"30b9802b-c9f1-4c0e-bfc2-46c455192534","resolution":{"observed_at":"2026-08-06T19:26:13.617300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.620368Z","title":"Choquette-Choo, Daniel Paleka, Will Pearce, Hyrum Anderson, Andreas Terzis, Kurt Thomas, and Florian Tramèr","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.620368Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:bd9726f19ec63e30bd0a0c9da7a31de24330d623f73abc050761dcc2c20fba32","observation_id":"02cb49fa-74e4-4e07-a063-470147ef71b4","resolution":{"observed_at":"2026-08-06T19:26:13.620368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.756294Z","title":"Pappas, and Eric Wong","venue":null,"work_id":"473368c2-616a-4f7b-b16c-513796074f03","year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.623324Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:39acd3c1596906f5ed3cdcbfa44614792664a9588b8f883cccbacf0a188c605b","observation_id":"c8bfc56b-11d7-40ec-ae64-f31441799312","resolution":{"observed_at":"2026-08-06T19:26:14.759006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.748087Z","title":null,"venue":null,"work_id":"e659aa93-8578-466b-9bfb-5296e9dbc2d9","year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.628809Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:53b26e199440b42a7bc408459a647235b4085565019fe7981a9f9717896c3eb4","observation_id":"6ddbaa36-1a8e-4753-a0cb-f1f1a5097ff2","resolution":{"observed_at":"2026-08-06T19:26:14.750722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.631030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.631030Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:90430e079b880227f4da3e831da4d482bf5ca7a55bd30094c646675e805445e2","observation_id":"531a0242-9127-4b39-9423-4cd345f196ce","resolution":{"observed_at":"2026-08-06T19:26:13.631030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.633838Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.633838Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:bb01441c8b2ee4d26e90c387a6e3e400c44b64c6256cfce0aa82e7d5a6d5a4d2","observation_id":"476dc5b1-9d65-4071-a5d5-c515f8dd0743","resolution":{"observed_at":"2026-08-06T19:26:13.633838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.02276","last_updated":"2021-05-10T15:58:21Z","snapshot_observed_at":"2026-07-06T09:52:58.810285Z","submitted_at":"2020-09-04T16:17:54Z","title":"Witches' Brew: Industrial Scale Data Poisoning via Gradient Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.02276","snapshot_observed_at":"2026-08-06T19:26:13.636474Z","title":"Ronny Huang, Wojciech Czaja, Gavin Taylor, Michael Moeller, and Tom Goldstein","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.636474Z"},"links":{"cited_paper":"/paper/2009.02276","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:ca60add5ba6bcbd099e26dc4822d01a61e5931420b44a68619d31382e5da1467","observation_id":"4942d2f7-4109-44a6-875d-4337cbeef09b","resolution":{"observed_at":"2026-08-06T19:26:13.636474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.639279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.639279Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:82dc45f258df6cea10724d283b6a2476f8a9311db0174921e632a99f1184ca69","observation_id":"e14f1808-760f-4f9d-9e25-0064345434c5","resolution":{"observed_at":"2026-08-06T19:26:13.639279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-07-06T17:29:39.117068Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-06T19:26:13.641819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.641819Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:fa34a1b767d706492972527bb3ff8ddd30eba5455f1c2bf8e7454f677ac94d6c","observation_id":"7cdc94e7-169b-41ab-9e61-63d88ead5892","resolution":{"observed_at":"2026-08-06T19:26:13.641819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06972","last_updated":"2023-12-22T18:01:44Z","snapshot_observed_at":"2026-07-06T15:26:06.998516Z","submitted_at":"2023-05-11T16:55:19Z","title":"Spear Phishing With Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06972","snapshot_observed_at":"2026-08-06T19:26:13.644775Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.644775Z"},"links":{"cited_paper":"/paper/2305.06972","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:78ee13b13cbbb025348233c44e7e6f6512a681f0ccd76a3693aa56bbc9e33ba6","observation_id":"80b1ca02-e5b2-4eee-9478-02fdb5d7fc13","resolution":{"observed_at":"2026-08-06T19:26:13.644775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.647771Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.647771Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:d202ad1bfee3ba446fa475fd5cb6d0ef794e8b75fe4ef03425a04c67743d86e2","observation_id":"98e29875-b7c1-437f-85a8-100450f892cc","resolution":{"observed_at":"2026-08-06T19:26:13.647771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.734290Z","title":null,"venue":null,"work_id":"6d6bd3cd-bb2e-4579-b7cc-cb2fa96437b1","year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.650243Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:7ea2444e07512c11ff8d649b2191c88fbc3d5a904b6bec5bdb87c67e0011fbb3","observation_id":"9e4f2b11-53a5-4094-8815-5e9e01119140","resolution":{"observed_at":"2026-08-06T19:26:14.737212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.726257Z","title":null,"venue":null,"work_id":"305ad1d3-27eb-46d6-9324-6e3f5c204f8d","year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.655580Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:1b33c367918585eb75881591deec530f34262b3c8f19694aee387957fc333067","observation_id":"c6f50e58-8a14-4848-87c0-f017685c0b7d","resolution":{"observed_at":"2026-08-06T19:26:14.729005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05733","last_updated":"2023-02-11T15:57:44Z","snapshot_observed_at":"2026-07-06T14:50:49.200455Z","submitted_at":"2023-02-11T15:57:44Z","title":"Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05733","snapshot_observed_at":"2026-08-06T19:26:13.657815Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.657815Z"},"links":{"cited_paper":"/paper/2302.05733","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:64fd8e123bcb9cf509cc3fc5f71eeaecd4ef6ac2c899965368fb46d3891e8f32","observation_id":"87c3da8a-2bd1-4af8-98b4-e89550e2d730","resolution":{"observed_at":"2026-08-06T19:26:13.657815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.660236Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.660236Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:cb3e71c38008c5508e5d2116918b14e7e79ffe51e107acd2d5bf963314d21b6a","observation_id":"b40b8ec5-7e71-45ec-bedd-8243e5ef1417","resolution":{"observed_at":"2026-08-06T19:26:13.660236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.662534Z","title":"Rittichier, and Arjan Durresi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.662534Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:02094e4a10d2604f0cefb339f699f61a707dcd7dba338b98320e6a5f6d09ebf4","observation_id":"3b48f360-31bb-43ea-974a-bc0199787763","resolution":{"observed_at":"2026-08-06T19:26:13.662534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.665283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.665283Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:3ecd38d7ceca02756c7dd08868d4fc1ea45b45457708c2c69f2649c03d8daa70","observation_id":"e73887ee-08c2-40a3-a43c-aac12429632a","resolution":{"observed_at":"2026-08-06T19:26:13.665283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08201","last_updated":"2024-12-11T08:44:15Z","snapshot_observed_at":"2026-07-06T20:05:10.188170Z","submitted_at":"2024-12-11T08:44:15Z","title":"Model-Editing-Based Jailbreak against Safety-aligned Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08201","snapshot_observed_at":"2026-08-06T19:26:13.667591Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.667591Z"},"links":{"cited_paper":"/paper/2412.08201","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:fcee15cf4756cdcdff007844c3ae5d7d8bd1ccd6b29d5cc2acd9dc70900db5c6","observation_id":"94c0eb51-f047-4d71-8efb-c7589c1f0868","resolution":{"observed_at":"2026-08-06T19:26:13.667591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18280","last_updated":"2025-05-17T04:37:43Z","snapshot_observed_at":"2026-07-06T20:28:24.203633Z","submitted_at":"2025-01-30T11:37:40Z","title":"Jailbreaking LLMs' Safeguard with Universal Magic Words for Text Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18280","snapshot_observed_at":"2026-08-06T19:26:13.670577Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.670577Z"},"links":{"cited_paper":"/paper/2501.18280","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:9d1776644ba6fbbc4daebd8be652568f83bac673635bb074b53f8892076c4ed8","observation_id":"42b7747e-964d-4fe7-b669-fb29a6f538a6","resolution":{"observed_at":"2026-08-06T19:26:13.670577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-06T19:26:13.673300Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.673300Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:84a6d6c2478a072a3056fe600f45dc6b7b3c2c3f7708a6580667e7c71c6cce67","observation_id":"6db6c64f-ac0e-4da1-992b-425d213778a7","resolution":{"observed_at":"2026-08-06T19:26:13.673300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.712746Z","title":null,"venue":null,"work_id":"31d33475-b3b6-4ba0-b60b-fce0388a5005","year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.676210Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:af18e0d02b8d16d30a57d036254ead812e8162228651956850f26d68ea8a8e5b","observation_id":"bdf684ec-85ff-47f2-9438-2d466cb5b72c","resolution":{"observed_at":"2026-08-06T19:26:14.715425Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:26:13.678386Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.678386Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:03f4dc4c976051123658d9d17130224c25fe16139379e471ffb6d6cca2aa1594","observation_id":"68e302d3-e619-4d0b-84c4-3b73a9b0e679","resolution":{"observed_at":"2026-08-06T19:26:13.678386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.705108Z","title":null,"venue":null,"work_id":"9104d378-4972-44f2-80fe-d57e3ebd0098","year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.680832Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:89be55ceac293ef097774e008e06a291657a24754bfd7b76549a7efe1a202d6f","observation_id":"73850077-4b26-41fa-a24e-18ed6395c167","resolution":{"observed_at":"2026-08-06T19:26:14.707705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.697287Z","title":null,"venue":null,"work_id":"e4f62e94-9ebf-4730-8a7d-4439ccef79b8","year":2013},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.683041Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:99be56c6bc10f1511056cfabfa81f1bbbb7a537e3205c8c30476e5d699e22602","observation_id":"213609da-1b1c-4db5-a740-f181633f182b","resolution":{"observed_at":"2026-08-06T19:26:14.699821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.689200Z","title":null,"venue":null,"work_id":"975a317d-debd-4dc8-ba18-41c29fbdd085","year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.685528Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:86aa1ab24b2b53eb6affffba0d7c1b31fa0da61fbccaa21bfb395ac16e692b85","observation_id":"2c166ecd-6c9c-4812-953d-a714f858e181","resolution":{"observed_at":"2026-08-06T19:26:14.691654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08858","last_updated":"2025-04-20T05:41:14Z","snapshot_observed_at":"2026-07-06T19:31:53.397265Z","submitted_at":"2024-10-11T14:39:24Z","title":"Decoding Secret Memorization in Code LLMs Through Token-Level Characterization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08858","snapshot_observed_at":"2026-08-06T19:26:13.688117Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.688117Z"},"links":{"cited_paper":"/paper/2410.08858","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:69751781ef14ef058be3472c538eeac4211873f26b6a576e0dc3a79af63ac813","observation_id":"01691c5f-dae3-40c1-9116-06b610c643ec","resolution":{"observed_at":"2026-08-06T19:26:13.688117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:26:13.691187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.691187Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:e1f1335422ad77609fa31bdd2eab4b60423db0982a12a16d5786754c5d36eed5","observation_id":"e3d6dce4-9beb-45f8-9a67-f8cd306c2940","resolution":{"observed_at":"2026-08-06T19:26:13.691187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.681677Z","title":null,"venue":null,"work_id":"5eba42a5-50ca-438e-b8d9-da697b02eda4","year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.693897Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:5a9837db3d6db6f31be32df821905733d28f0c72631445a34cb74582b8065033","observation_id":"64cbc338-cbb8-4047-ac27-1d1d234b21d8","resolution":{"observed_at":"2026-08-06T19:26:14.684118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.673551Z","title":null,"venue":null,"work_id":"40bfc150-4401-4740-b684-f18c72e293e7","year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.696362Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:bd2ee0db5c7190aa29d1c6d6a260d8b704cb6183557388e3d8339a4804d0f98f","observation_id":"714362e4-ee54-4d44-9a9f-d4e5159de77e","resolution":{"observed_at":"2026-08-06T19:26:14.676617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-06T08:16:16.062348Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-06T19:26:13.702267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.702267Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:b7433578189bb781133e0f277add8404a1cf3791282f8b10c6d3ff77cb451c8f","observation_id":"a3edde7a-2b09-4096-9e4b-c3d793d59ec3","resolution":{"observed_at":"2026-08-06T19:26:13.702267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-06T19:26:13.705071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.705071Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:8bf54deea09390c40f14d11152270dff59fceb3b54f48cb040fe94207da6a112","observation_id":"153125d9-9a68-44fb-ae2f-33c5cd59c40e","resolution":{"observed_at":"2026-08-06T19:26:13.705071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.658028Z","title":null,"venue":null,"work_id":"308accd3-2491-405f-b19e-f2ea76c5b787","year":2020},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.707736Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:fcabeee26da5fd1beff0b2f8de3ac09718753bf6aea3a2bd3e3a01ea6b36348a","observation_id":"70402ed4-0f5f-4170-b963-4ad0be384ac7","resolution":{"observed_at":"2026-08-06T19:26:14.660638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.710725Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.710725Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:fe23a4be5efbbb06121ce84876b9ac123239a641f010afa5158fda8807875c14","observation_id":"a85a7e06-bc5f-4fb8-90b7-1f3bff35dfed","resolution":{"observed_at":"2026-08-06T19:26:13.710725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19737","last_updated":"2023-10-30T17:01:02Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:01:02Z","title":"Adversarial Attacks and Defenses in Large Language Models: Old and New Threats","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19737","snapshot_observed_at":"2026-08-06T19:26:13.716377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.716377Z"},"links":{"cited_paper":"/paper/2310.19737","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:1ba1ed03714987c9f738957f5ba6125a7c91dfde113ebf013e3e2f061392f25e","observation_id":"56e86c98-86db-4e90-9e14-86e48abcbd8e","resolution":{"observed_at":"2026-08-06T19:26:13.716377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09063","last_updated":"2025-04-16T15:15:56Z","snapshot_observed_at":"2026-07-06T17:29:56.393307Z","submitted_at":"2024-02-14T10:20:03Z","title":"Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09063","snapshot_observed_at":"2026-08-06T19:26:13.718850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.718850Z"},"links":{"cited_paper":"/paper/2402.09063","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:784b7c18eda2616094e400280953edf9dd906b0f9c721701b7cbb0bb0b20e0f6","observation_id":"c0fae038-732b-47ca-9473-9237fc0effa6","resolution":{"observed_at":"2026-08-06T19:26:13.718850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.645319Z","title":null,"venue":null,"work_id":"a974e5a4-e98e-4865-b328-741c1f255b23","year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.721307Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:d6ef696dc2560678056ea7f239fd99144baed1bc63147d1fa71bd6a476c41ac2","observation_id":"cfd7c191-22a8-4785-afc3-458679be44a1","resolution":{"observed_at":"2026-08-06T19:26:14.647814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.723589Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.723589Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:799e573b287330107a9d74dc24386634cdcaae20c04cd1a58ae32beff3cddf90","observation_id":"36edf4a4-93eb-44fb-bf6a-913a69bd8446","resolution":{"observed_at":"2026-08-06T19:26:13.723589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.632916Z","title":null,"venue":null,"work_id":"fd2f8cfb-c813-4a8b-9140-2fc29dc1428b","year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.725753Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:7f491d700d2339e4cfedc5b9f3c67df51b93a95944dc48eb5336f768a56fb8ba","observation_id":"b1c4b421-96e4-4c44-a26b-d25cac4cfb86","resolution":{"observed_at":"2026-08-06T19:26:14.635425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.625533Z","title":null,"venue":null,"work_id":"9b117493-a218-4190-a37f-137998906092","year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.728119Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:297e1f79f9ca6390f370b8cdd13f7787aeec81dc0e1bc5647612f857cb4394e0","observation_id":"7c772fc0-2e04-47b0-a9ff-5da75ae40362","resolution":{"observed_at":"2026-08-06T19:26:14.627959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:26:13.730532Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.730532Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:cc43b87b737c0763e0aef6b414cce9fecc14637105dcb778c18020bc6b783c62","observation_id":"e43774cb-6eaa-4dcc-b7f2-7580eb4a6769","resolution":{"observed_at":"2026-08-06T19:26:13.730532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.733803Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.733803Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:4f7649e2ebb7b924f3fc3e0c80f4bfe7627725e8df2edbc63db62cf220604a15","observation_id":"da060de6-3b05-48f5-8992-3716a41bfc7f","resolution":{"observed_at":"2026-08-06T19:26:13.733803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00944","last_updated":"2023-05-01T16:57:33Z","snapshot_observed_at":"2026-07-06T15:21:57.592347Z","submitted_at":"2023-05-01T16:57:33Z","title":"Poisoning Language Models During Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00944","snapshot_observed_at":"2026-08-06T19:26:13.736202Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.736202Z"},"links":{"cited_paper":"/paper/2305.00944","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:294e400930d076bae59a0ab53ef4be39445c9c3eee274f1568dc989d81f6e106","observation_id":"353eeb47-4bf9-4bcf-b914-8dd221df76fc","resolution":{"observed_at":"2026-08-06T19:26:13.736202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01527","last_updated":"2024-01-14T04:38:25Z","snapshot_observed_at":"2026-07-06T17:11:04.789413Z","submitted_at":"2024-01-03T03:40:53Z","title":"Poisoning Attacks against Recommender Systems: A Survey","version":3},"cited_work":{"arxiv_id":"2401.01527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01527","snapshot_observed_at":"2026-08-06T19:26:14.148640Z","title":"Poisoning Attacks against Recommender Systems: A Survey","venue":"cs.IR","work_id":"24fa1f7d-d59b-4bef-899b-c9d4e6749573","year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.738590Z"},"links":{"cited_paper":"/paper/2401.01527","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:b60f4500a6fd30cff69bdc8a8cb313b1af318763e3fcd87260f891d611130a22","observation_id":"e13a7e2d-232a-4f9e-9cdb-8fb90bdbf0f4","resolution":{"observed_at":"2026-08-06T19:26:14.151515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T19:26:13.741057Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.741057Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:0105017b4bd2507324b1d806d759208c3cc3508485f9f5b60627e97cc7e073ad","observation_id":"0a8f1628-907c-4c60-a507-6016e1d7eea4","resolution":{"observed_at":"2026-08-06T19:26:13.741057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T19:26:13.743717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.743717Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:78fc6ddef506266ec3d845cdadc5627cdd663b30410286e3ef7a7ee9f61f8144","observation_id":"78c43e03-bdbb-458f-83aa-5413134e33b9","resolution":{"observed_at":"2026-08-06T19:26:13.743717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.746263Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.746263Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:911064556a25d86952dbb8d772ff80c006bae7b46766d3ea8ae2d1d341930343","observation_id":"f389e0b7-354a-4671-bdfb-2bbe5d8459d3","resolution":{"observed_at":"2026-08-06T19:26:13.746263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07560","last_updated":"2025-02-17T12:57:42Z","snapshot_observed_at":"2026-08-07T04:08:50.557221Z","submitted_at":"2025-02-11T13:57:30Z","title":"Navigating Semantic Drift in Task-Agnostic Class-Incremental Learning","version":2},"cited_work":{"arxiv_id":"2502.07560","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07560","snapshot_observed_at":"2026-08-06T19:26:14.120444Z","title":"Navigating Semantic Drift in Task-Agnostic Class-Incremental Learning","venue":"cs.CV","work_id":"fe2a1964-626a-4904-a09a-e769f05b97df","year":2025},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.748695Z"},"links":{"cited_paper":"/paper/2502.07560","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:cecd0fee51087919fa911ce3783540d95ccd6710fd9c09155593d82188dea7d8","observation_id":"a4fbffae-b71b-463c-99a2-76741c84795f","resolution":{"observed_at":"2026-08-06T19:26:14.125247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.751199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.751199Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:b741aa7a23fe4918b975e2e5f4686a46ff54d7bf733145e5c1decf81e380a7f1","observation_id":"0e7a2ca2-816b-4295-9c41-9eeadba19a99","resolution":{"observed_at":"2026-08-06T19:26:13.751199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T19:26:13.753557Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.753557Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:8c7d4903c3a370b68b9f9307687704affd8ee44b2a48555aa37fa565af2fe54b","observation_id":"adf00763-98f3-4885-96fc-cc9efec81ba4","resolution":{"observed_at":"2026-08-06T19:26:13.753557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-06T19:26:13.755908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.755908Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:16f8300f5097e0eefc0d31230fb4c9283c9ce6b3973822e3e2dc6e40b2a652ce","observation_id":"f7ee0b76-e1ea-426c-b837-ad7777a81516","resolution":{"observed_at":"2026-08-06T19:26:13.755908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.758637Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.758637Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:d056d87c40067f6ab4372568cedb7bdea56fec7e899771b6659f847c891a0233","observation_id":"314cba2b-a856-4c3b-89a3-5eb01feec2ea","resolution":{"observed_at":"2026-08-06T19:26:13.758637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03644","last_updated":"2024-12-04T14:27:06Z","snapshot_observed_at":"2026-07-06T18:10:33.673157Z","submitted_at":"2024-05-06T17:07:28Z","title":"When LLMs Meet Cybersecurity: A Systematic Literature Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03644","snapshot_observed_at":"2026-08-06T19:26:13.760965Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.760965Z"},"links":{"cited_paper":"/paper/2405.03644","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:2d0c792d6930bd9f478e6214f9b26a62495f8cced02fa7d99005b2df56793056","observation_id":"041659d5-19be-4c6b-a56d-f0db0a4fc0b7","resolution":{"observed_at":"2026-08-06T19:26:13.760965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.763688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.763688Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:449c4dc33c9c143e31e3c3ae900851e7ae0f324aa27eb2d3dd56c90d75d6611d","observation_id":"adb8111b-9767-47ee-805a-65a144a3ac4c","resolution":{"observed_at":"2026-08-06T19:26:13.763688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-06T19:26:13.766148Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.766148Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:518903bf9dfbb76db37ac60615cc2db943c67501209d4ddec341206747ef4024","observation_id":"844513cb-37d2-4861-9209-5cd40fa6cf9e","resolution":{"observed_at":"2026-08-06T19:26:13.766148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:13.768941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.768941Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:fb52ea13cfebdf560dbd28e354a324d56783852397aaf7137c935068c9cc29de","observation_id":"7dd113a5-6f02-49bb-b354-1774b536c7dc","resolution":{"observed_at":"2026-08-06T19:26:13.768941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15207","last_updated":"2025-04-01T05:01:15Z","snapshot_observed_at":"2026-08-03T15:58:00.424591Z","submitted_at":"2024-08-27T17:14:21Z","title":"Understanding the Effectiveness of Coverage Criteria for Large Language Models: A Special Angle from Jailbreak Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15207","snapshot_observed_at":"2026-08-06T19:26:13.771379Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.771379Z"},"links":{"cited_paper":"/paper/2408.15207","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:ae705cfc1e17f4452536d23383f4ec5e2ef7d0c5c9856174f24c6ff228ec4f79","observation_id":"c7dc684a-6fcc-421b-843b-5c36214d6415","resolution":{"observed_at":"2026-08-06T19:26:13.771379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:26:13.774858Z","title":"Rating: [[rating]]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.774858Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:cf84b4fc7e86282e4935a9725f72ac31a3de7a454dd446ba8586b8d64dfff77b","observation_id":"a23e8d93-7f7b-4d19-8c45-61b2b66b355d","resolution":{"observed_at":"2026-08-06T19:26:13.774858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.607726Z","title":null,"venue":null,"work_id":"b37b5b3e-fff5-4dd2-8ded-b1faec864f73","year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.777653Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:05551b8016df481d9e023d29f7c83a92b8867caddc007ea1ad0ce446e0db9dd0","observation_id":"1681ef50-917c-4518-b035-aac0e19e9642","resolution":{"observed_at":"2026-08-06T19:26:14.610511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.599395Z","title":null,"venue":null,"work_id":"dec3681a-b705-46b5-8c44-2c737129de55","year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.780234Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:6fbc19c5a5e41717b4868a24906f18f50bcc17d6eb6f82805c5a33bf9cef052d","observation_id":"5bd1987f-b35d-4ec5-bcff-7fa264b0a7be","resolution":{"observed_at":"2026-08-06T19:26:14.601969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.590291Z","title":"Hacking is illegal and unethical, and I would never do anything that could put someone’s security at risk","venue":null,"work_id":"a68784f2-e809-4008-97db-5110492221de","year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.782513Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:09f84a393b7f656fbd9cbac9ae996a96bfdc3818ffaf8aec96c5d6f0b12659ce","observation_id":"26d41793-0f18-404f-ae25-3e4c53e3b453","resolution":{"observed_at":"2026-08-06T19:26:14.593579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T19:26:13.713457Z","title":"arXiv:1707.06347 [cs.LG] https: //arxiv.org/abs/1707.06347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.713457Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:56002c13f13b7d26e37c28ed8ea489008ebefb9eb1b962782d34e3fa174e5725","observation_id":"8c34e16b-35ee-460b-b07f-cf5d67bd9f90","resolution":{"observed_at":"2026-08-06T19:26:13.713457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T19:26:13.373964Z","title":"arXiv:2204.05862 [cs.CL] https://arxiv.org/abs/2204.05862","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.373964Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:15b3eb7d7e39848b42b79efc02db0cb1150f11e055404c0470ae344b3d880db5","observation_id":"61ff9eb1-732c-465e-9779-3fb2647bd335","resolution":{"observed_at":"2026-08-06T19:26:13.373964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:26:14.665652Z","title":"In The Eleventh International Conference on Learning Representations","venue":null,"work_id":"da272468-e2fe-4236-9688-e27399018ba2","year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.699124Z"},"links":{"citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:32f149946aa861ec34195e4b52ac9a43de3f7aeaf5446d83bf9462c3bd88087c","observation_id":"afc78d83-20d1-4167-82b1-cbaad99b9178","resolution":{"observed_at":"2026-08-06T19:26:14.668413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17433","last_updated":"2025-01-29T06:24:58Z","snapshot_observed_at":"2026-08-06T08:51:13.562155Z","submitted_at":"2025-01-29T06:24:58Z","title":"Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17433","snapshot_observed_at":"2026-08-06T19:26:13.652637Z","title":"arXiv:2501.17433 [cs.CR] https://arxiv.org/abs/2501.17433","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.652637Z"},"links":{"cited_paper":"/paper/2501.17433","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:72dbc3d813d96b057fb38e078b4f9ea62cd275475f777a5a872e4da7a5be5149","observation_id":"f5ba8e02-9b42-4f11-a9f4-f1c4444f7204","resolution":{"observed_at":"2026-08-06T19:26:13.652637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2507.08020."}