{"as_of":"2026-08-07T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2172dd6b6f2ee8207c50b5ed1c78a6b09e70b4591398f7b0d1084a867f58b666","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:35:48.626472Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.14202/citation-record","integrity":"/paper/2507.14202/integrity","json":"/paper/2507.14202/citation-record.json","paper":"/paper/2507.14202"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.238850Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.238850Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:13a23acfe71cfefbc512d30e31a12b807b385fdf67420af6b61efe175e188721","observation_id":"5b6a9238-00de-4972-a6c5-c256e98d095c","resolution":{"observed_at":"2026-08-06T17:35:47.238850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.390160Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.390160Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:b1dcd2d2202ce0f3130f3a38e7980705ff43f4080cd06f764393993d1a864935","observation_id":"25cf31f4-6c6d-409f-b5cb-f7b395d031a2","resolution":{"observed_at":"2026-08-06T17:35:47.390160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.424574Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.424574Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d314f5e474151e328f45e0b44084b0d1d47d3d0c231fc0a6cc6bd846d69344f8","observation_id":"5a2af6a0-2e86-4504-8cbc-6ffeed6a1cde","resolution":{"observed_at":"2026-08-06T17:35:47.424574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07998","last_updated":"2018-09-24T20:29:35Z","snapshot_observed_at":"2026-07-06T06:34:41.441373Z","submitted_at":"2018-04-21T17:02:20Z","title":"Generating Natural Language Adversarial Examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07998","snapshot_observed_at":"2026-08-06T17:35:47.437181Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.437181Z"},"links":{"cited_paper":"/paper/1804.07998","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:477c1dbc314470eb7371dcac4b623375b61456d59a5ab2a827f52b07f5f34538","observation_id":"bb252c79-5804-47f0-aa0b-2b0227ac2c84","resolution":{"observed_at":"2026-08-06T17:35:47.437181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-06T17:35:47.468119Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.468119Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c667c461652c5720261cd396ae361d3860f09bd1d4861bf9207896cf1ecaa809","observation_id":"ffcb86b7-123f-42ce-8130-0269d61955ec","resolution":{"observed_at":"2026-08-06T17:35:47.468119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05224","last_updated":"2022-04-08T14:53:06Z","snapshot_observed_at":"2026-08-06T15:59:49.226599Z","submitted_at":"2021-12-09T21:48:29Z","title":"Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures","version":2},"cited_work":{"arxiv_id":"2112.05224","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05224","snapshot_observed_at":"2026-08-06T17:35:50.528049Z","title":"Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures","venue":"cs.CR","work_id":"50406d64-0435-486d-9ba7-3e3cd2554d81","year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.522560Z"},"links":{"cited_paper":"/paper/2112.05224","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a48d07aed64501d8b30296348225f1de2267cfefae3ad68eda1152412b6da308","observation_id":"adcb3d4e-4952-4233-a7a6-2fef21cd219c","resolution":{"observed_at":"2026-08-06T17:35:50.534543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T17:35:47.608128Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.608128Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:f55eba0f4814eb1364214d6da8aebc88e47831e2f5fd88c2f2e6dd31d7cf23aa","observation_id":"1f8b8625-ea52-45ea-9324-d027089e80ba","resolution":{"observed_at":"2026-08-06T17:35:47.608128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T17:35:47.723342Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.723342Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:604d4d7edd948c329235b718a2569b6bc0e78ffe6cb66a4173dcaff21dffa14d","observation_id":"b29ff979-9448-4e35-8bf3-47d149d4744a","resolution":{"observed_at":"2026-08-06T17:35:47.723342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00236","last_updated":"2024-09-17T19:56:09Z","snapshot_observed_at":"2026-08-06T06:17:45.496933Z","submitted_at":"2023-09-01T03:53:40Z","title":"Image Hijacks: Adversarial Images can Control Generative Models at Runtime","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00236","snapshot_observed_at":"2026-08-06T17:35:47.822419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.822419Z"},"links":{"cited_paper":"/paper/2309.00236","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9b21b5dec84aedff6d963aca4e5ee15f95bfdbfccb0a7efebd63dd717450703a","observation_id":"517e308b-7e38-4685-85ce-e9f649f6d4c3","resolution":{"observed_at":"2026-08-06T17:35:47.822419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.897090Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.897090Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:67219d0e2b0d3f017bc80cc8377b9a61826742680caec5a8458fc57b3725d0f4","observation_id":"d51cbcab-b7d2-41ed-9e8c-b1dc9bbbc282","resolution":{"observed_at":"2026-08-06T17:35:47.897090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.960711Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.960711Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:6ac1bf508c148442093cc35bda6b4d78537e782a26542795a560f392ee4f589f","observation_id":"8202b0ae-a407-4800-8fcc-ad004b22a9d0","resolution":{"observed_at":"2026-08-06T17:35:47.960711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.970414Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.970414Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:4fcf9ad80cf8a0439c2010bbb208ec5d3ac112ec7e22ac59d4e51601423a2da0","observation_id":"21677c54-689c-4f87-803a-53f3d739d648","resolution":{"observed_at":"2026-08-06T17:35:47.970414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T17:35:47.975977Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.975977Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8247c761559df56cb621c002c6bfb201eb89aa057e0f3a8f218765d0f3d09ac4","observation_id":"ce3d1067-2d5b-4af6-bd46-b95bde12f133","resolution":{"observed_at":"2026-08-06T17:35:47.975977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02128","last_updated":"2022-09-05T20:29:17Z","snapshot_observed_at":"2026-08-04T07:20:43.897179Z","submitted_at":"2022-09-05T20:29:17Z","title":"Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02128","snapshot_observed_at":"2026-08-06T17:35:47.982288Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.982288Z"},"links":{"cited_paper":"/paper/2209.02128","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:cf3a9a64e8e36ca08fa7ce0bca84afb26ae24faa7f29895a684d974c20332a32","observation_id":"bafa7bb3-a8c0-48c3-884f-7ca91f77b74e","resolution":{"observed_at":"2026-08-06T17:35:47.982288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.989197Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.989197Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:070b5337857c7d9ebfbf2f8c04def6240af17d3cbb32b10f505ae3752949b0f2","observation_id":"b26876fb-8ead-4a31-9765-0039acb31008","resolution":{"observed_at":"2026-08-06T17:35:47.989197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:47.996109Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:47.996109Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:64fc1b2fa4114c1d4a3bf366ca947d039073ec5c29a1c63b65d16f9072239712","observation_id":"4bb4e62a-f278-4460-86c3-e2119a30d3e8","resolution":{"observed_at":"2026-08-06T17:35:47.996109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-06T17:35:48.002781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.002781Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:057f0dbc9cdfc24096728f3abdc0da80eb7b02bf588f8f245b90f7f5d8351a59","observation_id":"8a5a0256-0ed2-4a11-a324-0a6ae5dfe732","resolution":{"observed_at":"2026-08-06T17:35:48.002781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T17:35:48.010807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.010807Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:97a5528807bbcc56ef3f0a3209ece747598b539efca2951460f2edf356e78dd7","observation_id":"ee47c9ff-dcb0-43a9-a097-9fad4e0e75d8","resolution":{"observed_at":"2026-08-06T17:35:48.010807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-06T17:35:48.018055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.018055Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:1cb17a6fe6e52cd5e19c422a9ba10cc1a7f2e0a2b3a456478f077cd1d53f460b","observation_id":"4fd144ea-56ba-462c-b157-c2c2fccc610b","resolution":{"observed_at":"2026-08-06T17:35:48.018055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.025371Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.025371Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:322c6b633638bc11c17574a739d7207d76b5c7678f93fcf2113313fb1e124e07","observation_id":"2f3b1b5c-6c78-4d68-a448-028cd001b60f","resolution":{"observed_at":"2026-08-06T17:35:48.025371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T17:35:48.035926Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.035926Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:80471b785b1f933a280b949a45b0c4f8b0b47385a0bc76f360df2aa89f226d20","observation_id":"670b6015-0d51-4533-b7e0-7978b003fe56","resolution":{"observed_at":"2026-08-06T17:35:48.035926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-06T17:35:48.042843Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.042843Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:ca425cea0c097810b9fc1cda074431e2cf3cdc69493e2e66deeefb00a456c417","observation_id":"3aa09c3e-12c8-4063-9d99-bb9690b6accf","resolution":{"observed_at":"2026-08-06T17:35:48.042843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.053465Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.053465Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a97bc9c300b1aa39808e04eb6f0d9c52f657a3aeedecf56a7dd2c94eba51a06c","observation_id":"3d70f730-9dc9-4af2-bf75-7a0924bd6251","resolution":{"observed_at":"2026-08-06T17:35:48.053465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08575","last_updated":"2018-10-19T16:30:48Z","snapshot_observed_at":"2026-08-04T21:33:05.702276Z","submitted_at":"2018-10-19T16:30:48Z","title":"Supervising strong learners by amplifying weak experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08575","snapshot_observed_at":"2026-08-06T17:35:48.063524Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.063524Z"},"links":{"cited_paper":"/paper/1810.08575","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:26de992d40112da7be6ec02543dfe0c348a6dab4406c2d7c01f69fa5e77068c7","observation_id":"a11d8663-aa43-4de8-bd1e-a858946f0824","resolution":{"observed_at":"2026-08-06T17:35:48.063524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.070951Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.070951Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:132d715e84b56a80ba7ed7b4d3c24f890eaf27588483c92cdc590bbedb7aff41","observation_id":"9f0d440a-ef33-4ceb-9f85-df8526eb4c94","resolution":{"observed_at":"2026-08-06T17:35:48.070951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T17:35:48.078087Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.078087Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:6a3dd538b879011d5f9850856aad3b3015b60d7c11d2319b6243543b6778861c","observation_id":"c904d3f8-3630-4b9d-8b71-f52597e821f0","resolution":{"observed_at":"2026-08-06T17:35:48.078087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-07-06T16:30:25.358715Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-08-06T17:35:48.084454Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.084454Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:7bf642376601de627c38b31cb6c632dc92523ec16899ee34e05c02914a5c28e0","observation_id":"d6639d9f-321d-44b7-ab7f-ad5bad9c5d6b","resolution":{"observed_at":"2026-08-06T17:35:48.084454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.092363Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.092363Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:7fcab70e35b0ca477279ad7abb5895f3c9b76e97ebfe3c67a3392630b5881cc4","observation_id":"68c61a06-cfae-48e7-abb9-2bb1571c8feb","resolution":{"observed_at":"2026-08-06T17:35:48.092363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.07754","last_updated":"2019-11-18T16:35:13Z","snapshot_observed_at":"2026-07-06T08:37:54.279213Z","submitted_at":"2019-11-18T16:35:13Z","title":"Understanding parameter differences between analyses employing nested data subsets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.07754","snapshot_observed_at":"2026-08-06T17:35:48.100821Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.100821Z"},"links":{"cited_paper":"/paper/1911.07754","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:edb0a23f2e948d17ea9c5e688f1371286f9d6e30c13e31ef9b8995a8793d6233","observation_id":"9acddfb3-9cda-4059-94d5-cd8bd0434b18","resolution":{"observed_at":"2026-08-06T17:35:48.100821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.109664Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.109664Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9b05116b9ef926b97d557eb0ed707ed95a6aad0e152fc689244eaf8365300038","observation_id":"7f34939f-ae70-482c-8392-47ddccbdb6f8","resolution":{"observed_at":"2026-08-06T17:35:48.109664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06751","last_updated":"2018-05-24T16:43:45Z","snapshot_observed_at":"2026-07-06T06:15:02.045009Z","submitted_at":"2017-12-19T02:15:19Z","title":"HotFlip: White-Box Adversarial Examples for Text Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06751","snapshot_observed_at":"2026-08-06T17:35:48.119501Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.119501Z"},"links":{"cited_paper":"/paper/1712.06751","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:aa74ed566a44ab4a6b8f205048e2df32ed0a8a06c339f18f9729ca0a3f0896c7","observation_id":"26c25ec9-a7aa-48cb-96d2-11d2f2c0cce6","resolution":{"observed_at":"2026-08-06T17:35:48.119501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.128310Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.128310Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:f17392167ec50b0974d7f9549905120cd4407961f6ad6542ff4b58fb5696668a","observation_id":"3f696111-d4ca-4c96-85f0-7d428d2af8ab","resolution":{"observed_at":"2026-08-06T17:35:48.128310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-06T17:35:48.134541Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.134541Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:b5b7aecbc6e9aeb6ff40fde475a7c9f74b3eb049e52204703b6b95d8af6c2ac9","observation_id":"c42d8818-3e1d-410f-87ba-4fa7f898a85c","resolution":{"observed_at":"2026-08-06T17:35:48.134541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-06T17:35:48.142756Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.142756Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:4c18c9dcdf1315601c5b11a657241aec944242e008a3cbd9baec3ef6634b175a","observation_id":"2ce2fcbd-d0d9-4e9e-9491-0c12d0b58c02","resolution":{"observed_at":"2026-08-06T17:35:48.142756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-07-06T09:58:19.547859Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-06T17:35:48.151517Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.151517Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:64a760ee79874ecdb1c4ff18fcd5c57c0bd6c7b0f7209c591d2abd1c1c3dae9e","observation_id":"a90ddecf-99c1-405b-be46-b442ad14d8ed","resolution":{"observed_at":"2026-08-06T17:35:48.151517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T17:35:48.158428Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.158428Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:492678ec70aeec584d7b709cb75051189b957bfb594139b79fd02a3152ee0773","observation_id":"ebcc7130-ae12-485b-8d12-beb2658a661d","resolution":{"observed_at":"2026-08-06T17:35:48.158428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12173","last_updated":"2023-05-05T14:26:17Z","snapshot_observed_at":"2026-07-06T14:55:08.682906Z","submitted_at":"2023-02-23T17:14:38Z","title":"Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12173","snapshot_observed_at":"2026-08-06T17:35:48.166666Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.166666Z"},"links":{"cited_paper":"/paper/2302.12173","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a8d6f59e25658c5e02d53d5cb6aa9c7f63dccb33975d1d4b0921a72a43d4321c","observation_id":"b94e92c5-e06a-46e3-8ddb-3c4b945c6be3","resolution":{"observed_at":"2026-08-06T17:35:48.166666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.974143Z","title":null,"venue":null,"work_id":"23a57c1f-16eb-40e9-b7b0-c4e5874271b5","year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.174906Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:fd4d1d9a88f40a78a105d54186b2411324b0d940ddb708496f72d3603f210c94","observation_id":"590e6d0d-c3b9-4aa1-91cb-f62b13467cb5","resolution":{"observed_at":"2026-08-06T17:35:50.981468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T17:35:48.184013Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.184013Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:ba413116df5b2f6ff06b4693376f9caa38372d024aceee89a6be0ac1f7f0126b","observation_id":"0358867b-52e6-45ba-b59c-97ede6e52fe3","resolution":{"observed_at":"2026-08-06T17:35:48.184013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T17:35:48.190750Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.190750Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:b8784e16773893f01dd6b7f091d1b0a1b36a78aa471af94e0e88dce1e00a10ed","observation_id":"28085756-3d06-4400-9799-143a92401037","resolution":{"observed_at":"2026-08-06T17:35:48.190750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-02T15:33:17.783178Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-06T17:35:48.198213Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.198213Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c93ad92aab8be6c7d4e95a1860ac466d5c41b44fd8c2d9eb52fd24e5363615df","observation_id":"6df30fc5-7a42-4e0a-883e-420551bc9683","resolution":{"observed_at":"2026-08-06T17:35:48.198213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.946613Z","title":null,"venue":null,"work_id":"d12c1d83-5cc5-44bb-add1-dc42eb103bc1","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.205695Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:b6853ffead565633f8f1f260de64ddb0107ff5a999d52d97edcab4755de10d6b","observation_id":"c3918a90-c15b-44a3-8567-3f9d1bed0a53","resolution":{"observed_at":"2026-08-06T17:35:50.954180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.918313Z","title":null,"venue":null,"work_id":"b34ce33b-1348-485b-82f7-976bafad14fb","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.215145Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:45fe224316ff6d62bcf8ba0201f0eac9234cc30e6b402e07975db29dddd88747","observation_id":"8e4b1b4f-1cda-4008-9ac4-a6828bb2fbb5","resolution":{"observed_at":"2026-08-06T17:35:50.925417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.889547Z","title":null,"venue":null,"work_id":"9d75dea4-ae34-4f8c-b0a4-eebd07b2c685","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.223231Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:f94b4e97853da886587322bca79f94942f684b360dc263e44680838b010132eb","observation_id":"8483a57a-aedc-4071-8651-da0a3aacd10c","resolution":{"observed_at":"2026-08-06T17:35:50.898671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04381","last_updated":"2023-03-08T05:09:59Z","snapshot_observed_at":"2026-07-06T15:00:01.455874Z","submitted_at":"2023-03-08T05:09:59Z","title":"Automatically Auditing Large Language Models via Discrete Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04381","snapshot_observed_at":"2026-08-06T17:35:48.231633Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.231633Z"},"links":{"cited_paper":"/paper/2303.04381","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:297e82244631cc39d37016b5782d04597896ec09f10732c2df5804e39d68345f","observation_id":"72828130-3626-46ec-aaa7-9b4442706d5a","resolution":{"observed_at":"2026-08-06T17:35:48.231633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02520","last_updated":"2023-11-13T15:54:07Z","snapshot_observed_at":"2026-07-06T16:43:09.498359Z","submitted_at":"2023-11-04T22:35:39Z","title":"Single-Source Shortest Paths with Negative Real Weights in $\\tilde{O}(mn^{8/9})$ Time","version":2},"cited_work":{"arxiv_id":"2311.02520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.02520","snapshot_observed_at":"2026-08-06T17:35:49.751092Z","title":"Single-Source Shortest Paths with Negative Real Weights in $\\tilde{O}(mn^{8/9})$ Time","venue":"cs.DS","work_id":"fa6c0261-593e-4844-aae6-dc6e46d144c8","year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.242664Z"},"links":{"cited_paper":"/paper/2311.02520","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:24b2d49483285eb11fe47f49ddeebfeab7f36c996ef18ea9373c24785e0950dd","observation_id":"c5bdc0bf-891b-4c3d-9cf6-b5b29d6825b6","resolution":{"observed_at":"2026-08-06T17:35:49.762344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01446","last_updated":"2024-08-05T11:34:10Z","snapshot_observed_at":"2026-08-04T21:02:05.722226Z","submitted_at":"2023-09-04T08:54:20Z","title":"Open Sesame! Universal Black Box Jailbreaking of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01446","snapshot_observed_at":"2026-08-06T17:35:48.251121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.251121Z"},"links":{"cited_paper":"/paper/2309.01446","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:186ab3a0c5a7169d54808df2e46e2506d1b7da5167e795ed10c5af4794305361","observation_id":"8e39d5a0-df53-4a41-813c-fd6d04b2881a","resolution":{"observed_at":"2026-08-06T17:35:48.251121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T17:35:48.260173Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.260173Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d023a8ffbd548c6c9b75ea8d73112a85baaef97ed1f8ebd60e90947e308044ad","observation_id":"6893840f-8913-456c-8bfe-03992331d013","resolution":{"observed_at":"2026-08-06T17:35:48.260173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09984","last_updated":"2020-10-02T03:08:04Z","snapshot_observed_at":"2026-07-06T09:14:04.157271Z","submitted_at":"2020-04-21T13:30:02Z","title":"BERT-ATTACK: Adversarial Attack Against BERT Using BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09984","snapshot_observed_at":"2026-08-06T17:35:48.267389Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.267389Z"},"links":{"cited_paper":"/paper/2004.09984","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8d046e2ef2af113642a16eecfa79c0e2c9fff9c668780e8b82bcc14e719871e4","observation_id":"c2709b8d-4f65-4d21-ab92-6b9473858fa6","resolution":{"observed_at":"2026-08-06T17:35:48.267389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T17:35:48.273778Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.273778Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:1ee84c5b9e75fabc779ed9d842b3c20761ff43d24afa5fed3d8a64dc892051ff","observation_id":"dd64e832-2a45-4da9-bb99-41539ed0ca24","resolution":{"observed_at":"2026-08-06T17:35:48.273778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13860","last_updated":"2024-03-10T13:58:08Z","snapshot_observed_at":"2026-07-06T15:31:18.144952Z","submitted_at":"2023-05-23T09:33:38Z","title":"Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13860","snapshot_observed_at":"2026-08-06T17:35:48.280960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.280960Z"},"links":{"cited_paper":"/paper/2305.13860","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:1b4ca0aeafdf1338db4a5e40b53d05cb7383bed022257be317572e30551a4c59","observation_id":"b907c4eb-d916-4cbd-8fa8-60a699c361d2","resolution":{"observed_at":"2026-08-06T17:35:48.280960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.289162Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.289162Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c5887da54e7e271ce0acd508ac8761db37a977770c1822864f327f9b6144ad30","observation_id":"67ea4d27-d6a9-4d67-a875-6c9bd7c3dada","resolution":{"observed_at":"2026-08-06T17:35:48.289162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-07-06T05:47:27.191725Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-06T17:35:48.302663Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.302663Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:6a973f0f5f48708c22bfcac451d91ee5e10b4cb9e9e31cf85c554838ddd5952b","observation_id":"c8382987-8b29-4efe-b8c6-1a8ea5283f86","resolution":{"observed_at":"2026-08-06T17:35:48.302663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.863305Z","title":null,"venue":null,"work_id":"aa75fa5c-7360-4e1e-a2c2-61fc3af47ccd","year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.312375Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:717faf8e9d75eb8885fbc393188963f486d0b38e9e961457d55576a7f2d0a0d6","observation_id":"455d04b7-778b-4caa-897a-b06d86de4b1b","resolution":{"observed_at":"2026-08-06T17:35:50.871578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-06T17:35:48.318958Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.318958Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:e89543746ffc65a2224c71ad9d269b4c9c5f347da6b8807be1642da8018663c2","observation_id":"53fcdf3a-c28f-4d2c-89ca-8008a48a9534","resolution":{"observed_at":"2026-08-06T17:35:48.318958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11147","last_updated":"2022-03-21T17:26:29Z","snapshot_observed_at":"2026-08-01T19:23:25.711617Z","submitted_at":"2022-03-21T17:26:29Z","title":"Teaching language models to support answers with verified quotes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11147","snapshot_observed_at":"2026-08-06T17:35:48.325823Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.325823Z"},"links":{"cited_paper":"/paper/2203.11147","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d97b1781b6215d88a7bfb2c92dfcda262c77e8787d7d049313ce66e82df85989","observation_id":"77b7dbcc-5efa-42cb-92e5-75aeb0e2ccae","resolution":{"observed_at":"2026-08-06T17:35:48.325823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.829249Z","title":null,"venue":null,"work_id":"01e5038e-ff35-40f0-b813-2b5ef10a90db","year":1995},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.334358Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:6f6956106d8ddd175ca690d208ddd8114fc245c23fb77a49710d158ca81339c6","observation_id":"55775cee-9169-4500-90d2-4eb9a2b99214","resolution":{"observed_at":"2026-08-06T17:35:50.842475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.806798Z","title":null,"venue":null,"work_id":"d458dddc-dde0-49e2-91a3-8ed275a43812","year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.340570Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9cf5a59759e741ad5fb45d61f410980f586a58d3e85b28f57c34c79ab96a695c","observation_id":"f5cccaa2-679e-4f61-81c4-4e13dd8d6e5f","resolution":{"observed_at":"2026-08-06T17:35:50.813928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05909","last_updated":"2020-10-05T00:10:24Z","snapshot_observed_at":"2026-08-05T07:11:54.244493Z","submitted_at":"2020-04-29T21:33:35Z","title":"TextAttack: A Framework for Adversarial Attacks, Data Augmentation, and Adversarial Training in NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05909","snapshot_observed_at":"2026-08-06T17:35:48.347629Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.347629Z"},"links":{"cited_paper":"/paper/2005.05909","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:0af40f928e81ac606584cc8b3565cd0147f0e1c8e0d9eac5e6881006c0f25787","observation_id":"103ae790-ec3e-4edf-bf4e-122cf26e8719","resolution":{"observed_at":"2026-08-06T17:35:48.347629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T17:35:48.355471Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.355471Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c4341debff8b9640f683a8d311dcaabb4ff5821a5872e14cf96f9db4636c4b0b","observation_id":"482fea23-f239-4910-9841-c2975ba97d87","resolution":{"observed_at":"2026-08-06T17:35:48.355471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17035","last_updated":"2023-11-28T18:47:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T18:47:03Z","title":"Scalable Extraction of Training Data from (Production) Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17035","snapshot_observed_at":"2026-08-06T17:35:48.362446Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.362446Z"},"links":{"cited_paper":"/paper/2311.17035","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9344866851b657a5e707fd67e27e75ef32aa2e4181ab539ab58760a19e15888e","observation_id":"a701af0a-b1cc-4a10-8629-972734d4f80b","resolution":{"observed_at":"2026-08-06T17:35:48.362446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.370906Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.370906Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:34af6cf9e1ffcc327ba2fbb5ee26b68eb15c9fe5cb04fd60ee0998e921ff73c2","observation_id":"569713c6-6f4f-406f-9e2d-46aca8eaa3e5","resolution":{"observed_at":"2026-08-06T17:35:48.370906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-06T17:35:48.379195Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.379195Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:6779ec93fb38715c5bd9fecfce0151731f2dc2e0144f1ae76d4a330391edb03e","observation_id":"206bfffb-3393-4296-b8ed-1a4e1c1631e4","resolution":{"observed_at":"2026-08-06T17:35:48.379195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-06T17:35:48.387140Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.387140Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:ce557a145bff12b761a647e9603c62092faa6447711195e01ae1882ae19038b0","observation_id":"1811695b-06f0-464a-b606-483a2f9e0eb1","resolution":{"observed_at":"2026-08-06T17:35:48.387140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09527","snapshot_observed_at":"2026-08-06T17:35:48.395357Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.395357Z"},"links":{"cited_paper":"/paper/2211.09527","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8c05863c5b225d28eaa69f2324678651d95992dc220b6c249e6a782275808aaf","observation_id":"3b8e7847-6a86-4fb4-8f3c-f5a359046bd3","resolution":{"observed_at":"2026-08-06T17:35:48.395357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.767969Z","title":null,"venue":null,"work_id":"cc26dfac-539a-496f-9c75-14faf4a902a2","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.406503Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:4cfe7ecf90ae125c17096e163d1c2400b980f876f00d2d58176e8ab81d5b2acd","observation_id":"83499b1b-c548-4c87-9a07-9c519391f9b0","resolution":{"observed_at":"2026-08-06T17:35:50.775043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06032","last_updated":"2019-08-26T22:36:02Z","snapshot_observed_at":"2026-07-06T08:00:16.619191Z","submitted_at":"2019-06-14T05:46:10Z","title":"Adversarial Training Can Hurt Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.06032","snapshot_observed_at":"2026-08-06T17:35:48.413261Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.413261Z"},"links":{"cited_paper":"/paper/1906.06032","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:88f0e0a23aaf963dd5b1c4db56da875371f361ed5dee16bbde6fc20d9adc65a7","observation_id":"3fb3cb18-7a56-41ee-aad5-997006c0baf9","resolution":{"observed_at":"2026-08-06T17:35:48.413261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.746586Z","title":null,"venue":null,"work_id":"802b8928-0039-484c-bfb8-6d540fb12678","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.420411Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:bcd8bf0136d933efe726c66d77726118935e151c7ae5b7177a7b6e9aaf70c043","observation_id":"453ce8c0-9e8e-4e86-8651-b26a2615ab74","resolution":{"observed_at":"2026-08-06T17:35:50.752692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T17:35:48.427520Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.427520Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:bb59358a70055f71ad50b65f0642ce3d0aceab3b6d8d5057da571355340face4","observation_id":"f1664621-df1b-4744-89eb-98e8f0ef31ba","resolution":{"observed_at":"2026-08-06T17:35:48.427520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T17:35:48.436360Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.436360Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c085e2cc3c68cf38705924b8918940cd876b3863699e29964ceb4f37ba107577","observation_id":"b853babb-024f-485f-bda8-0d6e9d553ba5","resolution":{"observed_at":"2026-08-06T17:35:48.436360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T17:35:48.445431Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.445431Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:3905e81660c470519889e91c3b66311ba3bbcefef6bde77b9d45669702196c0a","observation_id":"09e47225-07a6-48db-9c59-e42421f41fe9","resolution":{"observed_at":"2026-08-06T17:35:48.445431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:48.454219Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.454219Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:2a044595ea4103121866d8081ffe5a4d33758640b0e2bde717f1517b960508a4","observation_id":"0580d262-b859-4833-9516-6a4889a99700","resolution":{"observed_at":"2026-08-06T17:35:48.454219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.701780Z","title":null,"venue":null,"work_id":"0abe0cac-5913-4dc1-926d-94cd10a8215b","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.461142Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9c42014b24cb3acfbd99bfd3377edbd45ea6b22cc711789a1040339ee94c73b1","observation_id":"4360779b-94b6-4e1e-9494-feb52167a0a3","resolution":{"observed_at":"2026-08-06T17:35:50.710417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07204","last_updated":"2020-04-26T22:20:25Z","snapshot_observed_at":"2026-07-06T05:43:27.961693Z","submitted_at":"2017-05-19T21:56:43Z","title":"Ensemble Adversarial Training: Attacks and Defenses","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07204","snapshot_observed_at":"2026-08-06T17:35:48.467325Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.467325Z"},"links":{"cited_paper":"/paper/1705.07204","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:1e3477d31f675a9cf4addc830f5b275d22ab459bfe83248e762b848831743bab","observation_id":"5123c869-efcf-4be5-b141-c88b49df9fec","resolution":{"observed_at":"2026-08-06T17:35:48.467325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12152","last_updated":"2019-09-09T08:09:25Z","snapshot_observed_at":"2026-07-06T06:42:08.107734Z","submitted_at":"2018-05-30T18:00:32Z","title":"Robustness May Be at Odds with Accuracy","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12152","snapshot_observed_at":"2026-08-06T17:35:48.474839Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.474839Z"},"links":{"cited_paper":"/paper/1805.12152","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d8361aba3e15c01b76bc3f274af1aa380c6e641f41747076ec11cdbcb0f86bce","observation_id":"f7629bdb-6602-453e-9138-b15b6227f1d3","resolution":{"observed_at":"2026-08-06T17:35:48.474839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T17:35:48.481517Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.481517Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:977981ab3cb1e576090c246ae1ce5476c853d6b060cf21bb2c6cd68f0bc8bb4d","observation_id":"aefb1499-3f67-469c-b28d-49a7afe5f42f","resolution":{"observed_at":"2026-08-06T17:35:48.481517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07125","last_updated":"2021-01-03T19:58:55Z","snapshot_observed_at":"2026-07-06T08:15:25.894149Z","submitted_at":"2019-08-20T01:51:40Z","title":"Universal Adversarial Triggers for Attacking and Analyzing NLP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07125","snapshot_observed_at":"2026-08-06T17:35:48.488605Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.488605Z"},"links":{"cited_paper":"/paper/1908.07125","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:17bfbbde28e040d921a860e7675ccabcffb2f43b50d714079777cdbf835279f6","observation_id":"923ae7d5-0634-43e6-9a9a-5af5f2a7d9bd","resolution":{"observed_at":"2026-08-06T17:35:48.488605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-06T17:35:48.496124Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.496124Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:2af6a19afbdffe46b6e8c3bd5fc982c92af9123f7f01c9b60c2fb86e449dd716","observation_id":"1581c38e-115f-4014-b61b-b00e5933eef6","resolution":{"observed_at":"2026-08-06T17:35:48.496124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.681724Z","title":null,"venue":null,"work_id":"db61514e-8495-4dde-8d9d-850792e505cb","year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.505595Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:4eef32e0ff419d23969a7793339c732f8c9c1f602342689b0433761200d8b1f2","observation_id":"c204d952-f567-4cbe-8f4a-21ee9e541aa8","resolution":{"observed_at":"2026-08-06T17:35:50.688433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06723","last_updated":"2021-06-15T02:08:45Z","snapshot_observed_at":"2026-08-04T15:35:33.437256Z","submitted_at":"2019-09-15T03:35:18Z","title":"Natural Language Adversarial Defense through Synonym Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06723","snapshot_observed_at":"2026-08-06T17:35:48.513887Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.513887Z"},"links":{"cited_paper":"/paper/1909.06723","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:c29a74ed1abd0d51e4d8f7540b40f0aa723ac1a87ef72bc7a5c33fc1ab4f71a5","observation_id":"6314ad03-312d-443c-ada9-6fc5fa4f6b2f","resolution":{"observed_at":"2026-08-06T17:35:48.513887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T17:35:48.522431Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.522431Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:0c2fcc2ef5a80e33343acb07c8a11beddbc5bc87245020c6833adb446145da9c","observation_id":"0db3733e-7e4a-4a0e-ad85-2382dfd528e3","resolution":{"observed_at":"2026-08-06T17:35:48.522431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.660009Z","title":null,"venue":null,"work_id":"d4f9ff15-8ace-4cc5-b4e0-facfe96fd930","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.537349Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:51813b08eef2f05ffa984415959edad1508ef52ccbfdee899e29972c81476af5","observation_id":"51d9b036-4365-4a9c-b6c8-01475b3ad402","resolution":{"observed_at":"2026-08-06T17:35:50.666517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-06T17:35:48.545520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.545520Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:8c3857aaf0e95ba4ffc3e9138972bb9fd67080118b77819f80ce76393acb600c","observation_id":"85d265f5-a6dd-4f4c-bada-8c01f9655ca4","resolution":{"observed_at":"2026-08-06T17:35:48.545520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-06T17:35:48.553979Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.553979Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:67c5231d9cfc9a2b9436a60caed1e8501c1f62b98ee007019108d379e8a2dd13","observation_id":"822f62ee-5f4a-449b-8f91-4f6dc81ff76e","resolution":{"observed_at":"2026-08-06T17:35:48.553979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12517","last_updated":"2022-10-22T18:17:31Z","snapshot_observed_at":"2026-07-06T14:09:05.304905Z","submitted_at":"2022-10-22T18:17:31Z","title":"Exploring The Landscape of Distributional Robustness for Question Answering Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12517","snapshot_observed_at":"2026-08-06T17:35:48.560955Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.560955Z"},"links":{"cited_paper":"/paper/2210.12517","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:2f4c60dac00c5aeb83c32f2d103d0b2bb79091ce520cb998fd0ca79056b65cc6","observation_id":"c54eaadb-dc35-4b7f-a38a-b6c517553455","resolution":{"observed_at":"2026-08-06T17:35:48.560955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.636138Z","title":null,"venue":null,"work_id":"e4be9a6c-9e45-400f-962e-d9d8b9e0b91b","year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.569962Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:2961e09f52a36e9c8e133e9801913da6147e255199fdcce2fa21a767716de863","observation_id":"a8d55785-7081-4caa-a72b-e802dcad7c97","resolution":{"observed_at":"2026-08-06T17:35:50.642464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-06T17:35:48.576790Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.576790Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:d6cc8d9f68ca877b2afe17fbd016b89c9add8a88cc06dab74ae006d432b085dc","observation_id":"72c27dd0-14f0-497b-baa6-8cddeb7a5a7a","resolution":{"observed_at":"2026-08-06T17:35:48.576790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-06T17:35:48.582594Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.582594Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:3ee1a8b3651a0e3750c08bf2f174159b55db4786fba5bc34c7776f116f1e504d","observation_id":"015af25f-f1e0-4a56-bfe7-fea6ed1beb49","resolution":{"observed_at":"2026-08-06T17:35:48.582594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-06T17:35:48.591046Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.591046Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:1d197ea19ecdf896dc463b923831fd783759331929bf77361c51b502ac2dcbb2","observation_id":"84165dfd-1663-421f-965b-d33159b6d948","resolution":{"observed_at":"2026-08-06T17:35:48.591046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:35:50.607659Z","title":null,"venue":null,"work_id":"634b23a0-d640-449f-8f71-cfc80f57312e","year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.596978Z"},"links":{"citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:9ceaf3b50fa6a6a218080b58e9aee75511ca50f8b2f5651516caa590090b3ebc","observation_id":"88de92c1-1199-4988-946c-6ef565782d31","resolution":{"observed_at":"2026-08-06T17:35:50.613453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08994","last_updated":"2020-04-29T21:16:31Z","snapshot_observed_at":"2026-07-06T09:13:32.098523Z","submitted_at":"2020-04-20T00:07:18Z","title":"Adversarial Training for Large Neural Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.08994","snapshot_observed_at":"2026-08-06T17:35:48.602842Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.602842Z"},"links":{"cited_paper":"/paper/2004.08994","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:2f5102be46c1f72a9f113a6aa5e6f1eccbe880b2bb5821be01cd3a8d80ecfc67","observation_id":"8b547ac2-a353-4344-a0a0-525fd1af06e9","resolution":{"observed_at":"2026-08-06T17:35:48.602842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11764","last_updated":"2020-04-23T07:19:00Z","snapshot_observed_at":"2026-07-06T08:24:38.792721Z","submitted_at":"2019-09-25T20:50:32Z","title":"FreeLB: Enhanced Adversarial Training for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11764","snapshot_observed_at":"2026-08-06T17:35:48.609506Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.609506Z"},"links":{"cited_paper":"/paper/1909.11764","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:f775008ca84c345cba19fbbcb17cc9e4d16a3235c634b1af85777bee45afa285","observation_id":"2e6d12c9-8c1c-48d0-a294-1eeebdd0ef52","resolution":{"observed_at":"2026-08-06T17:35:48.609506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01663","last_updated":"2022-11-10T01:02:29Z","snapshot_observed_at":"2026-07-06T13:06:19.871022Z","submitted_at":"2022-05-03T17:50:06Z","title":"Adversarial Training for High-Stakes Reliability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01663","snapshot_observed_at":"2026-08-06T17:35:48.617525Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.617525Z"},"links":{"cited_paper":"/paper/2205.01663","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:7d8f68996821810c12ae82da15c23e30dd43941031328a05a7e9c314702751f2","observation_id":"350a898d-d298-48a8-bd4c-d7a3a13c8b39","resolution":{"observed_at":"2026-08-06T17:35:48.617525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:35:48.626472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.626472Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a230168ef072816241fd5279a6bdb345f4bf778a70e09f968b39d81b2efaecd3","observation_id":"bba77999-6c87-41b9-bf16-cc2d7c3a81ad","resolution":{"observed_at":"2026-08-06T17:35:48.626472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2507.14202."}