{"as_of":"2026-08-07T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18c3af8535ea0a07338b6d1c944c9a1803b948526bf01bc4c7938e21a2364492","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:34.619561Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23576/citation-record","integrity":"/paper/2506.23576/integrity","json":"/paper/2506.23576/citation-record.json","paper":"/paper/2506.23576"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:41:31.569741Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.569741Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:e892ec561963cea3b77551894b91343d3c3f72b5c7a5e6700b0f4f606d8d5036","observation_id":"8e43e7cf-29cd-4ad9-850a-c811fb9b455c","resolution":{"observed_at":"2026-08-06T21:41:31.569741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.827222Z","title":null,"venue":null,"work_id":"3d11f177-beca-49af-addd-2a5dee778362","year":2025},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.642646Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:30f5bba67b7d5dd0ca38d11f9c540d83f33d2e1be74bb04ff8d9725a720840b4","observation_id":"63df852d-0b36-47b4-b3ea-70a0c16d4b54","resolution":{"observed_at":"2026-08-06T21:41:37.882772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08705","last_updated":"2025-01-27T06:25:47Z","snapshot_observed_at":"2026-08-01T14:15:42.026898Z","submitted_at":"2024-06-13T00:04:15Z","title":"When LLM Meets DRL: Advancing Jailbreaking Efficiency via DRL-guided Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08705","snapshot_observed_at":"2026-08-06T21:41:31.775107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.775107Z"},"links":{"cited_paper":"/paper/2406.08705","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:bb7de1db06862f24542e8884e41377056fd5ea7a23a0bdb0829d534b01db2969","observation_id":"dad90268-745d-4f55-a7cd-89ce5bbbcb9b","resolution":{"observed_at":"2026-08-06T21:41:31.775107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.642626Z","title":null,"venue":null,"work_id":"df706170-f489-4fa4-b12f-65e4e8499d79","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.870183Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:7fda26bcc10f44086ecabc207654eb2b46ca18f6a83baaa4073431acb0a87211","observation_id":"f0340468-3cb9-43f1-b905-59447117624d","resolution":{"observed_at":"2026-08-06T21:41:37.735542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.480819Z","title":null,"venue":null,"work_id":"eddc6a39-72a4-45c6-8a37-81a45070da37","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.978909Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:48f853421a8a7930f64da78d4a8731d9763af888c72135753460153dcd6cc678","observation_id":"11f519fe-53e5-4fcf-aad9-ee56695ff500","resolution":{"observed_at":"2026-08-06T21:41:37.544331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-06T19:10:15.466826Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-06T21:41:32.066309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.066309Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:4b3759a2168f99c0869e5f5afceb6431289748810b3ee646d8a5b247d03e6187","observation_id":"55082143-3bfe-4b38-a55a-7b06a3ba06b4","resolution":{"observed_at":"2026-08-06T21:41:32.066309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09002","last_updated":"2025-03-18T01:50:42Z","snapshot_observed_at":"2026-07-06T17:16:38.221230Z","submitted_at":"2024-01-17T06:42:44Z","title":"AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09002","snapshot_observed_at":"2026-08-06T21:41:32.179485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.179485Z"},"links":{"cited_paper":"/paper/2401.09002","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:2845e87fce9194ca839aa4a2dd0b8a5045a0c024517661f32a327d9938938fe5","observation_id":"7719205a-30a7-406c-a4d1-3789277d62ba","resolution":{"observed_at":"2026-08-06T21:41:32.179485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.371667Z","title":null,"venue":null,"work_id":"5e0d7aae-ecdd-472d-b09d-329389774b92","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.294079Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:adafe66bf4b914086be6b89e3a3ab5979584d19b350e3f70030bd320ae1d1bf8","observation_id":"1d23ad2b-ae21-4bea-809f-4ad8982b6653","resolution":{"observed_at":"2026-08-06T21:41:37.421508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09638","last_updated":"2025-05-29T06:12:00Z","snapshot_observed_at":"2026-08-03T10:15:56.112014Z","submitted_at":"2025-02-09T20:49:16Z","title":"Jailbreaking to Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09638","snapshot_observed_at":"2026-08-06T21:41:32.402159Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.402159Z"},"links":{"cited_paper":"/paper/2502.09638","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:044acc0ca8bb56add68df966a08ffd672531bf52da061ddecbbac76920d757f1","observation_id":"61244cb6-d150-4479-a0f4-0b60b47b0928","resolution":{"observed_at":"2026-08-06T21:41:32.402159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.187437Z","title":null,"venue":null,"work_id":"7e9000e2-57c5-4d99-915a-f96c145ddf3d","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.480662Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:177f71eb6aa1a8d64802edd137218683ec9832dc7ad5729ec8f324a7cc9bbfb1","observation_id":"2aeb45a3-687f-434d-aaf1-a11c57f59af6","resolution":{"observed_at":"2026-08-06T21:41:37.266962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.066878Z","title":null,"venue":null,"work_id":"9e7dba59-a384-44f9-8393-3e3ae14dc143","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.544244Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:12dbd5f7881b5ff7d8bb5c279647afe9cca5408f83292bfab4d9dc0f50a3bc22","observation_id":"9c76a9d2-554d-4376-afb9-2af3fe97ea22","resolution":{"observed_at":"2026-08-06T21:41:37.107884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08660","last_updated":"2024-11-29T02:35:47Z","snapshot_observed_at":"2026-08-04T04:24:17.015186Z","submitted_at":"2024-10-11T09:39:11Z","title":"RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08660","snapshot_observed_at":"2026-08-06T21:41:32.667915Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.667915Z"},"links":{"cited_paper":"/paper/2410.08660","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:ff269fb5c4f165c22b173205d2f86f1f05b597d6cc0c4f5910880cfbdfa1c2ef","observation_id":"18400649-ca3b-4d1a-97cf-3a6f226404e2","resolution":{"observed_at":"2026-08-06T21:41:32.667915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:32.797527Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.797527Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:6bcf2ce53dd6d7adb9765373264ac50ed6f337b1b32ed59229b994e93df9de73","observation_id":"d98b9e72-fa89-4596-9c15-9d8e9ccb38f2","resolution":{"observed_at":"2026-08-06T21:41:32.797527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.971871Z","title":null,"venue":null,"work_id":"b50add1c-b1df-496f-8164-9f50edcbbc6d","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.908201Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:ba070fa457e339204536376006fbc99e1504118b0b3874e183ead6836e4b9098","observation_id":"9548ce44-e233-4e68-8a5a-01ed227282a1","resolution":{"observed_at":"2026-08-06T21:41:37.019524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-07T06:17:52.920196Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-06T21:41:33.012697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.012697Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:41cf6a5e59f062c555d49a7f36164c8f30c4d69b029d65b17e8c405251057d15","observation_id":"f41a7bbc-2b48-4cb1-b593-8e1176907018","resolution":{"observed_at":"2026-08-06T21:41:33.012697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.864388Z","title":null,"venue":null,"work_id":"9908d30b-3692-4acb-ba9e-ea3a164eae0f","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.120780Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:0b616a1ce9ece150f811dbe30508fb8f7440a46497f40d51753623c80aa3292f","observation_id":"779d4ec6-b4db-4bd6-9093-842b07fac047","resolution":{"observed_at":"2026-08-06T21:41:36.928290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.766632Z","title":null,"venue":null,"work_id":"81c4e5a5-fcbf-401b-beac-fc5e7b077693","year":2025},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.257513Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:ce4d6812535da421ddccf337b49504f91d7794485b753e96ed1d3d7f7b38e303","observation_id":"2f2357ca-9191-4180-bd36-ecd3cd4348a6","resolution":{"observed_at":"2026-08-06T21:41:36.820563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05644","last_updated":"2024-06-13T05:39:31Z","snapshot_observed_at":"2026-08-04T01:38:16.363370Z","submitted_at":"2024-06-09T05:04:37Z","title":"How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05644","snapshot_observed_at":"2026-08-06T21:41:33.346536Z","title":"Stay in character!","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.346536Z"},"links":{"cited_paper":"/paper/2406.05644","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:6956e666c623054041260fb34bdba300e8ba891398b3929d97c840f46c9badf2","observation_id":"429d95b4-f72c-454b-a70f-8be9adf9e52c","resolution":{"observed_at":"2026-08-06T21:41:33.346536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.353349Z","title":"What would you suggest? 2_user: Judge, please make a judgment based on the analyzed intention and original prompts","venue":null,"work_id":"6e80123a-e0d8-4c5d-95e1-2dd1802431b8","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.560510Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:cde68684ec84ecfad9f78f1e0f4c2a6a80c9f27a2198242b9a2856fb2901c7b6","observation_id":"a17794b5-0f2d-46a2-a000-d4948ce74913","resolution":{"observed_at":"2026-08-06T21:41:36.407052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.189959Z","title":null,"venue":null,"work_id":"d05ad3c2-d0b4-4c27-a3ca-1bbb778594d2","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.640766Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:83fb86aa464ef895d4338caa226323090f02c47c03eb1d920b9fa08a2d8438ff","observation_id":"5a830f6f-e7b8-4853-8076-e469969ea28a","resolution":{"observed_at":"2026-08-06T21:41:36.274875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.038033Z","title":null,"venue":null,"work_id":"8181e97f-e629-4fdb-9403-037358b55c56","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.735370Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:d727458ce810247d59a19597836e592925cf84b76c0db03f84d92d6631550d37","observation_id":"a220a37d-3aca-4753-90b1-701e198f310b","resolution":{"observed_at":"2026-08-06T21:41:36.114780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.874190Z","title":"Here is a list of tools you will need to cut down a stop sign: Angle grinder, Metal cutting blade","venue":null,"work_id":"aec5d173-9ea4-4e6c-b9c3-1ae31714f76d","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.875948Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:5a357c4223c096379549c0323dcb9de253307ed51f62a640bdc23d48041b3d6a","observation_id":"3fe5232f-f34d-4056-a6bd-199ee5f77b5e","resolution":{"observed_at":"2026-08-06T21:41:35.901116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.666683Z","title":null,"venue":null,"work_id":"cd66129f-8a75-4615-a1c1-9f38e81617f7","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.993763Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:3e23883d4e0e1312ca270445938f41e716c79f0755d193852107eb418b238e3e","observation_id":"1aa3f8eb-2ac1-4e47-9a30-63d156f2a908","resolution":{"observed_at":"2026-08-06T21:41:36.700284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.530585Z","title":null,"venue":null,"work_id":"b43a5cc4-4d67-46b8-852b-4ca5e2c681eb","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.157348Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:7fd597e3201c1335effff2a6acc0b6a070639274d8423899a88579b5747efdf4","observation_id":"5a9d1608-760b-4567-a73c-f8794c7f1fad","resolution":{"observed_at":"2026-08-06T21:41:36.598296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.637644Z","title":null,"venue":null,"work_id":"0c2561cc-fe2a-4691-8b7c-0fc788e573a9","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.260916Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:f61cf3268c11cd59ee059c77c708b0e9c09a99aed6be2f218bd8719f7a098eb3","observation_id":"d4314ac9-343a-45ba-96ea-960f906e0d42","resolution":{"observed_at":"2026-08-06T21:41:35.769997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.429176Z","title":null,"venue":null,"work_id":"1572c512-7e77-407b-b40f-6dab5c889656","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.381183Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:de4b7f8ba2e3c010eb912928d8b22927df0b995b763ce5b29e3ef9575ce47b16","observation_id":"14b046ef-021a-49fa-9f08-6be0b9979390","resolution":{"observed_at":"2026-08-06T21:41:35.508136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.131811Z","title":null,"venue":null,"work_id":"eedbe28a-51ab-4c35-b008-3340d011ef78","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.525963Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:9d0a45f13b0007900d2a3cd0a8a1323971c2544d37f63d0f23b77982cc8a6a27","observation_id":"bed85a64-c841-465a-9347-efc9cb491c5a","resolution":{"observed_at":"2026-08-06T21:41:35.273258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:34.856949Z","title":"–SYSTEM INPUT START– [INSERT INPUT HERE] –SYSTEM INPUT END– ALWAYS START YOUR RESPONSE WITH ’I am the Judge","venue":null,"work_id":"291a1685-c4d2-4f7d-afb0-7812366f8a09","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.619561Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:abc6695c2eb2ddd78d4f4c3e740bf0fe3c40849375cb32ba3999b6bf9824f2eb","observation_id":"5d10d028-a239-4d7d-a730-0115d840743e","resolution":{"observed_at":"2026-08-06T21:41:34.987433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T06:18:43.781682Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2506.23576."}