{"as_of":"2026-08-07T12:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c27625ea92bd85209a98075ac96817a974e225ab2c11abf6e91c1c2bbb55e75e","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:50:25.717337Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T01:28:07.221590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T18:55:58.422476Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2604.11309","last_updated":"2026-04-13T11:12:30Z","snapshot_observed_at":"2026-07-30T17:13:57.164751Z","submitted_at":"2026-04-13T11:12:30Z","title":"The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:31.602378Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2604.11309"},"observation_digest":"sha256:a41fe00690d59f2fd104322c59cd5d64a2e02e7565df8c6908008ec87d39e60c","observation_id":"15d0bef9-8dc8-4ab5-a86e-a1d3216ca85b","resolution":{"observed_at":"2026-05-11T09:16:04.380533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2605.08277","last_updated":"2026-05-08T06:33:42Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T06:33:42Z","title":"Mitigating Many-shot Jailbreak Attacks with One Single Demonstration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:19.648405Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2605.08277"},"observation_digest":"sha256:d65ffd788b99aad05dd9f347e20bfa378a7fe0bb42d1ad0c17d331834bf4d99c","observation_id":"ad50daed-644a-472a-93fc-0ab8ed1ea288","resolution":{"observed_at":"2026-05-12T00:51:14.989743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2605.16471","last_updated":"2026-05-15T13:53:02Z","snapshot_observed_at":"2026-07-06T23:27:38.955917Z","submitted_at":"2026-05-15T13:53:02Z","title":"From AI-Generated Content to Agentic Action: Security and Safety Threats in Generative AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T18:08:24.901025Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2605.16471"},"observation_digest":"sha256:1b3aa7a22b35deb6e018538b336e25fe5340ed3e47a6a5a6f83864564494e103","observation_id":"bcb86915-e183-4ac1-a23d-d2f1285ca74b","resolution":{"observed_at":"2026-05-20T18:08:50.541169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2606.27567","last_updated":"2026-06-25T21:52:29Z","snapshot_observed_at":"2026-08-03T07:11:41.290800Z","submitted_at":"2026-06-25T21:52:29Z","title":"On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T01:28:07.221590Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2606.27567"},"observation_digest":"sha256:8219b26403aaffc318ac930cee4e4ef2c8d1c542bdd90adcaf365c177666778b","observation_id":"889f0505-845f-4f7d-b10c-838f7a34905f","resolution":{"observed_at":"2026-07-01T18:55:58.424358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02956/citation-record","integrity":"/paper/2507.02956/integrity","json":"/paper/2507.02956/citation-record.json","paper":"/paper/2507.02956"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:23.638511Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.638511Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:5b0135a0804d47650c10272e22a746e0cdbbcf302bdf855d83b96a846708f468","observation_id":"8c3456ac-1348-47f6-a910-eef0958bb212","resolution":{"observed_at":"2026-08-06T21:50:23.638511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03131","last_updated":"2024-09-10T21:53:46Z","snapshot_observed_at":"2026-08-07T09:27:01.287002Z","submitted_at":"2024-09-04T23:45:10Z","title":"Well, that escalated quickly: The Single-Turn Crescendo Attack (STCA)","version":2},"cited_work":{"arxiv_id":"2409.03131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03131","snapshot_observed_at":"2026-08-06T21:50:26.234402Z","title":"Well, that escalated quickly: The Single-Turn Crescendo Attack (STCA)","venue":"cs.CR","work_id":"ba503ba0-8f64-49ca-a101-c56758fda13d","year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.682275Z"},"links":{"cited_paper":"/paper/2409.03131","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:6c13bb38f32482d0b1d878829ce55614fce86997e03e8fce3892722c0a1b1dd0","observation_id":"476c410e-88e4-4910-9937-32e74c627486","resolution":{"observed_at":"2026-08-06T21:50:26.290852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:50:23.718505Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.718505Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:ad28ddc043040c03dcda3b10795f2843a0cd979e4f22a671ef14333c674e6f7d","observation_id":"8d36f44d-8bb5-4879-9bdf-42d0bc633329","resolution":{"observed_at":"2026-08-06T21:50:23.718505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T21:50:23.813973Z","title":"E., Fort, S., Lanham, T., Telleen-Lawton, T., Conerly, T., Henighan, T., Hume, T., Bowman, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.813973Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:9c35a0c4d5ea594f057f94de9454b203edc4b2570659bcbfcd7d7ff231953c21","observation_id":"4b4a4ebe-5b5e-4188-87ae-6913e3b6696e","resolution":{"observed_at":"2026-08-06T21:50:23.813973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-06T21:50:23.931047Z","title":"J., and Wong, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.931047Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:a1ef98472cffd4c9ec1897b37afbfd1a61b1f8e5d72d96caa9686f8a083d82fb","observation_id":"cedc3e42-4251-41be-abd5-a43435295f02","resolution":{"observed_at":"2026-08-06T21:50:23.931047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:50:24.041051Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.041051Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:c3b87434b25a519929777687a5dd78a64599e01686bf47fdbd08ee045477c63a","observation_id":"c45739ee-df9e-4c02-9caf-85f8fda83311","resolution":{"observed_at":"2026-08-06T21:50:24.041051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T21:50:24.108617Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., Chung, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.108617Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:adc237ec8b103ac145c02f47838fd42cc8f61569753c99cc4a679741e4afa1ec","observation_id":"d78fe336-7b68-4781-a6de-0a99ff02065d","resolution":{"observed_at":"2026-08-06T21:50:24.108617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-07-06T17:29:39.117068Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-06T21:50:24.189376Z","title":"Cold-attack: Jailbreaking llms with stealthiness and controllability, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.189376Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:4288b46a49ddd40981c2775e5d28512974434ffb9d41b30184e85a1b6be25a7c","observation_id":"eba21bb8-2c2f-4933-94eb-e0b8a11402c2","resolution":{"observed_at":"2026-08-06T21:50:24.189376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:24.261948Z","title":"Steering dialogue dynamics for robustness against multi-turn jailbreaking attacks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.261948Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:daa5694bb413065b1a29cef06a6a5849fca45210bff26787f985e3eca8ad13ca","observation_id":"87a9aac9-c8c8-44dc-a605-a480afb89877","resolution":{"observed_at":"2026-08-06T21:50:24.261948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15221","last_updated":"2024-09-04T00:58:59Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:33:30Z","title":"LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15221","snapshot_observed_at":"2026-08-06T21:50:24.381051Z","title":"Llm defenses are not robust to multi-turn human jailbreaks yet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.381051Z"},"links":{"cited_paper":"/paper/2408.15221","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:9790936006d005814c2837786dfb95157209fc21779518b945005677381097b1","observation_id":"c6e2f740-a3b4-4596-b545-b38fd8c10bda","resolution":{"observed_at":"2026-08-06T21:50:24.381051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:24.501823Z","title":"X-boundary: Establishing exact safety boundary to shield llms from multi-turn jailbreaks without compromising usability, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.501823Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:6b60b10934adeada38b073f928a8074f9ae45d5934d25c4f3f3194351d8da4ae","observation_id":"218f2879-44f5-42f8-b73c-0f0c7aae61c5","resolution":{"observed_at":"2026-08-06T21:50:24.501823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-06T21:50:24.594454Z","title":"Tree of attacks: Jailbreaking black-box llms automatically, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.594454Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:f0a702fad19d17400369610d9ef755d5dcf44f7889835f06572a61975c8f0e49","observation_id":"ca0ad785-49d1-417c-ab53-21df10b7f92d","resolution":{"observed_at":"2026-08-06T21:50:24.594454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02828","last_updated":"2024-10-01T17:00:59Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-01T17:00:59Z","title":"PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02828","snapshot_observed_at":"2026-08-06T21:50:24.688041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.688041Z"},"links":{"cited_paper":"/paper/2410.02828","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:c329f29b05ae2ae517b52c6f9979b6f718ef276149f79247827927309880f296","observation_id":"3a8ce7cb-43d4-49a9-9712-bc9a094941ff","resolution":{"observed_at":"2026-08-06T21:50:24.688041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01606","last_updated":"2024-10-02T14:47:05Z","snapshot_observed_at":"2026-08-03T19:54:21.584740Z","submitted_at":"2024-10-02T14:47:05Z","title":"Automated Red Teaming with GOAT: the Generative Offensive Agent Tester","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01606","snapshot_observed_at":"2026-08-06T21:50:24.807231Z","title":"C., Evtimov, I., and Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.807231Z"},"links":{"cited_paper":"/paper/2410.01606","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:59ba0d8cd4e6ea7b735a03a9d3d89226d56eb3a80893ce5098dd3a71cf07cd34","observation_id":"de570d9d-cb13-4aed-84ad-1348293e97ca","resolution":{"observed_at":"2026-08-06T21:50:24.807231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01833","last_updated":"2025-02-26T13:41:41Z","snapshot_observed_at":"2026-08-03T07:26:39.431128Z","submitted_at":"2024-04-02T10:45:49Z","title":"Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01833","snapshot_observed_at":"2026-08-06T21:50:24.901579Z","title":"Great, now write an article about that: The crescendo multi-turn llm jailbreak attack, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.901579Z"},"links":{"cited_paper":"/paper/2404.01833","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:bdce37b6130febd91552dc9b1cd635224f414695f85d1b7db9f2002395cce8aa","observation_id":"986520c3-098d-47ef-84fd-10564fb86639","resolution":{"observed_at":"2026-08-06T21:50:24.901579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09063","last_updated":"2025-04-16T15:15:56Z","snapshot_observed_at":"2026-07-06T17:29:56.393307Z","submitted_at":"2024-02-14T10:20:03Z","title":"Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09063","snapshot_observed_at":"2026-08-06T21:50:25.052460Z","title":"Soft prompt threats: Attacking safety alignment and unlearning in open-source llms through the embedding space, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.052460Z"},"links":{"cited_paper":"/paper/2402.09063","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:842d64c1d7fc00c333e65f8ce24d1ff30c67d957a04ecea2e0b6f5b0eec6f0c2","observation_id":"d96455b2-84ed-4436-8021-783c7711c8d1","resolution":{"observed_at":"2026-08-06T21:50:25.052460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-06T21:50:25.121585Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.121585Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:7cd1234a25fb47d2681fd9b50e51dd35486ba17c2c7bde283a778ecc7e60a471","observation_id":"3b287634-43b3-4732-a2ec-965d9f8786e2","resolution":{"observed_at":"2026-08-06T21:50:25.121585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:25.217506Z","title":"Taxonomy, opportunities, and challenges of representation engineering for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.217506Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:9358c7bd933c997d2d7d4356828f1e7320d9f482790880086166534838e71757","observation_id":"3aed3228-bacd-4e80-817f-1acc3b673ee6","resolution":{"observed_at":"2026-08-06T21:50:25.217506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01550","last_updated":"2025-07-15T02:52:56Z","snapshot_observed_at":"2026-07-06T21:02:56.962346Z","submitted_at":"2025-04-02T09:47:01Z","title":"Representation Bending for Large Language Model Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01550","snapshot_observed_at":"2026-08-06T21:50:25.299707Z","title":"S., Lee, S., Jeung, W., Han, S., Wan, A., Ngan, H., Yu, Y., and Choi, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.299707Z"},"links":{"cited_paper":"/paper/2504.01550","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:c981b6f4eefb02f92cf855031fc70c38ed31dce8d9ef4147edd47bc47c1c05b5","observation_id":"6a125ad1-e518-4342-b435-8c35075d0f98","resolution":{"observed_at":"2026-08-06T21:50:25.299707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10619","last_updated":"2025-05-28T09:31:33Z","snapshot_observed_at":"2026-08-02T12:09:36.861596Z","submitted_at":"2025-03-13T17:57:32Z","title":"Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10619","snapshot_observed_at":"2026-08-06T21:50:25.394358Z","title":"and Arel, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.394358Z"},"links":{"cited_paper":"/paper/2503.10619","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:c4060008b8cf147b45b38a7142a6993fbf9e3d5f55713883e3780a6ecd966f52","observation_id":"1fb5d3d7-f02d-4e4d-bae5-75e22877ec81","resolution":{"observed_at":"2026-08-06T21:50:25.394358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-06T21:50:25.505408Z","title":"J., Wang, Z., Mallen, A., Basart, S., Koyejo, S., Song, D., Fredrikson, M., Kolter, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.505408Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:7ecaca45d119e842bd1646cb84a6969071a1041c1a571517b0edf83f304abfdd","observation_id":"9ec2eda3-b55d-4171-9724-fd207bff6ccd","resolution":{"observed_at":"2026-08-06T21:50:25.505408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T21:50:25.591506Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.591506Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:e1519757ac70a25cae07bcd629dfafb24f82de60a29ca786c6c096dfd7b2467c","observation_id":"cc2a659d-dbc5-46c1-9da7-b01d1cc11c60","resolution":{"observed_at":"2026-08-06T21:50:25.591506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04313","last_updated":"2024-07-12T16:51:07Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:57:04Z","title":"Improving Alignment and Robustness with Circuit Breakers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04313","snapshot_observed_at":"2026-08-06T21:50:25.717337Z","title":"Improving alignment and robustness with circuit breakers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.717337Z"},"links":{"cited_paper":"/paper/2406.04313","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:fbfbd413193d8359d370000696170b92afdf33b78a4451f20a349f2183b83152","observation_id":"b01ed218-98a2-470d-8d2b-fde3eb6d002b","resolution":{"observed_at":"2026-08-06T21:50:25.717337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T21:40:50.164647Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 4 inbound Pith citation observations for arXiv:2507.02956."}