{"as_of":"2026-08-16T00:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3e95206626c777514f9d9edd46b1432d453bacec24c967551ff77aaa85e983b","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:24:26.027983Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:59:12.695984Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T07:05:29.201563Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"cited_work":{"arxiv_id":"2512.20806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.20806","snapshot_observed_at":"2026-07-01T07:05:29.201563Z","title":"Solving a class of non-convex min-max games using iterative first order methods","venue":"cs.AI","work_id":"b26e558f-5377-4cb1-bd58-aa5cd021c3b0","year":2025},"citing_paper":{"arxiv_id":"2605.13806","last_updated":"2026-05-13T17:34:24Z","snapshot_observed_at":"2026-08-13T19:45:01.294788Z","submitted_at":"2026-05-13T17:34:24Z","title":"Min-Max Optimization Requires Exponentially Many Queries","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T17:32:35.323096Z"},"links":{"cited_paper":"/paper/2512.20806","citing_paper":"/paper/2605.13806"},"observation_digest":"sha256:5c21404782d8fd9e9172089eb74e162b9c4699a2e8104650d695ba25f9ddc064","observation_id":"e54d6df7-02b4-41e3-8926-b52b60a0c097","resolution":{"observed_at":"2026-06-02T03:04:03.431172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"cited_work":{"arxiv_id":"2512.20806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.20806","snapshot_observed_at":"2026-07-01T07:05:29.201563Z","title":"Solving a class of non-convex min-max games using iterative first order methods","venue":"cs.AI","work_id":"b26e558f-5377-4cb1-bd58-aa5cd021c3b0","year":2025},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2512.20806","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:70857d485be3edacbcfada7831482c27a8d1fdc2787df281083bb780f1dd94e9","observation_id":"4899a69f-4039-4ebf-ad0a-d966705a4b98","resolution":{"observed_at":"2026-07-01T07:05:29.203499Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.20806/citation-record","integrity":"/paper/2512.20806/integrity","json":"/paper/2512.20806/citation-record.json","paper":"/paper/2512.20806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:19.119202Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:19.119202Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:ce0da3d3929b9197e2b44bac75f00fec9455f82760adc3031ce782ea5a5aee68","observation_id":"6bf5036e-9e1a-458d-b043-f7f18c0a1599","resolution":{"observed_at":"2026-08-03T14:24:19.119202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-08-15T21:55:47.604051Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-03T14:24:19.243260Z","title":"Detecting language model attacks with perplexity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:19.243260Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:5c5cdf6101d8407e607598edbab87ea4e9e9d7eded369c4d3e477276e2c3c9ef","observation_id":"7ff424ec-665f-44c7-a3a9-d2a0a85ba77a","resolution":{"observed_at":"2026-08-03T14:24:19.243260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:19.380861Z","title":"Bowman, Ethan Perez, Roger Baker Grosse, and David Duvenaud","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:19.380861Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:1af3c1aa7e77168662896e6984b98800b48401f6fa2e24e3be179784ff67202b","observation_id":"95f9ed95-80b5-4fba-af4e-df963133336f","resolution":{"observed_at":"2026-08-03T14:24:19.380861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-13T05:46:47.001229Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-03T14:24:19.502646Z","title":"A general theoretical paradigm to understand learning from human preferences, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:19.502646Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:1463f7d7cbf2febe52e014e44b6eb7b23322fd5fff8cb21d248514185348d665","observation_id":"d058d0b3-5f42-4060-9235-c76e24e0b6db","resolution":{"observed_at":"2026-08-03T14:24:19.502646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:19.645830Z","title":"fairseq2, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:19.645830Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:081890b9832d0f957879b283b0f85266a4856bfdb42d5c81aabc4828a979a037","observation_id":"b8d70e4c-37b8-49f3-815d-20c75aaad14e","resolution":{"observed_at":"2026-08-03T14:24:19.645830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:19.798316Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:19.798316Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:69926de7b9696197e48f11374c49b6c1f6d361c5a46e3b71da53214961026fbc","observation_id":"f33b9f68-23bc-41fa-b925-36bd194a164f","resolution":{"observed_at":"2026-08-03T14:24:19.798316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:19.900634Z","title":null,"venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:19.900634Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:bb3b6324f130ae6d78234c6bc85d6e1a6d6467c1fb565a0706416b109d4feacd","observation_id":"c1755611-ecbb-46bf-9c15-e265afd4f6ca","resolution":{"observed_at":"2026-08-03T14:24:19.900634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:20.116626Z","title":"Human alignment of large language models through online preference optimisation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.116626Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:38a56b3663ce80567e829fe5ad1440a3d0cceea303b3ec69cd38ed85e2241330","observation_id":"55e80a70-57f3-4a7f-961b-905b65f616ad","resolution":{"observed_at":"2026-08-03T14:24:20.116626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-15T20:30:40.297931Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-03T14:24:20.197076Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.197076Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:79cc5ec5fd7c5658d21464834b816d2a63ecbffdd85de941518c1b4ddccefc43","observation_id":"c3ea4715-1646-4fc3-881d-10e6e7007410","resolution":{"observed_at":"2026-08-03T14:24:20.197076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:20.273057Z","title":"Meta secalign: A secure foundation llm against prompt injection attacks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.273057Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:6ff4cb3d48b18fdb724a1c801526aa6607a6bf4e2e5d12c8c04a62651aa82f68","observation_id":"5bb1361d-90dc-4864-bbf5-6d5116973cf1","resolution":{"observed_at":"2026-08-03T14:24:20.273057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01660","last_updated":"2025-04-11T23:24:37Z","snapshot_observed_at":"2026-08-14T23:17:15.854314Z","submitted_at":"2024-06-03T17:53:25Z","title":"Self-Improving Robust Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01660","snapshot_observed_at":"2026-08-03T14:24:20.383932Z","title":"Self-improving robust preference optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.383932Z"},"links":{"cited_paper":"/paper/2406.01660","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:481af1f4f060d90ad3b8cfb9bdb22f5829ef3f662d29d23f5443571dec94a6d8","observation_id":"b8e51d0a-c93e-4230-8877-7335e1f347d3","resolution":{"observed_at":"2026-08-03T14:24:20.383932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-03T14:24:20.525152Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.525152Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:da3883d67b72f8e38b441e49f13cbdd3aea3c72863ddf7f00598323cf1d7576c","observation_id":"7d56223c-15ec-4bda-9d16-5631befa0c31","resolution":{"observed_at":"2026-08-03T14:24:20.525152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13352","last_updated":"2024-11-24T22:04:23Z","snapshot_observed_at":"2026-07-06T18:33:32.806635Z","submitted_at":"2024-06-19T08:55:56Z","title":"AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13352","snapshot_observed_at":"2026-08-03T14:24:20.592814Z","title":"Agentdojo: A dynamic environment to evaluate prompt injection attacks and defenses for llm agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.592814Z"},"links":{"cited_paper":"/paper/2406.13352","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:a96000b8b4a2879cf20a3dcf33fc5038f775c47bb9502a68f2ac6e1a73da0d44","observation_id":"af809779-a57c-4792-a76c-53d8f178c1ca","resolution":{"observed_at":"2026-08-03T14:24:20.592814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-03T14:24:20.677213Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.677213Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:e9dd300781afbcc88c95763365187302d03cec62c8cdc1ab0a623dae3362ff1e","observation_id":"332f2f8f-0d1f-4e1f-a2b5-edb9e47b25d5","resolution":{"observed_at":"2026-08-03T14:24:20.677213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18575","last_updated":"2025-05-16T22:42:29Z","snapshot_observed_at":"2026-08-15T08:43:14.412859Z","submitted_at":"2025-04-22T17:51:03Z","title":"WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18575","snapshot_observed_at":"2026-08-03T14:24:20.798535Z","title":"Wasp: Benchmarking web agent security against prompt injection attacks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.798535Z"},"links":{"cited_paper":"/paper/2504.18575","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:8a94cc8dde8d902f8cd5a1f1ffb16e00972f3919a52f51e4ea1913971412c442","observation_id":"e54ba365-56ae-4497-8569-70873de80b7d","resolution":{"observed_at":"2026-08-03T14:24:20.798535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13702","snapshot_observed_at":"2026-08-03T14:24:20.906356Z","title":"Value-free policy optimization via reward partitioning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.906356Z"},"links":{"cited_paper":"/paper/2506.13702","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:9999883c604fa308f12da04546e632144a38c90511e4d87d3883dd4581d0e85d","observation_id":"58037a65-8d50-481a-8f54-57238aecf6dd","resolution":{"observed_at":"2026-08-03T14:24:20.906356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:20.980576Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.980576Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:c1005e2efa27af5a9dbaa9fd0cc21e6458078cddf2e525da974299bac2704107","observation_id":"08b1e2a9-25b6-4b9d-b802-b1e902060ee4","resolution":{"observed_at":"2026-08-03T14:24:20.980576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:21.048650Z","title":"Gradient-based adversarial attacks against text transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.048650Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:62c18445de484ac0e643bb64cb25f6b494c9bd1a90229ba426079b232613fd45","observation_id":"f00abcb0-1e04-4554-b8e5-8bc5db70f088","resolution":{"observed_at":"2026-08-03T14:24:21.048650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-15T00:47:58.611457Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-03T14:24:21.154235Z","title":"Direct language model alignment from online ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.154235Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:8d93959856820ad79bfb932a017ce4426a67ac232545b446770aecbbfedb26ad","observation_id":"50f7b995-cb23-4176-9e28-933b1a7e0e1e","resolution":{"observed_at":"2026-08-03T14:24:21.154235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-12T20:12:20.465098Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-08-03T14:24:21.206299Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.206299Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:deff03b48ea79b881bc6a93c56b8935adc9f424ddfca3d5877b7541880ff28ad","observation_id":"92013bd9-5452-4c18-a068-03be9b71889c","resolution":{"observed_at":"2026-08-03T14:24:21.206299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-03T14:24:21.308997Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.308997Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:829fb9453171e30ccbd2eae3284f6b45e88e8f5758c2f2259ec2962fe2b643b0","observation_id":"fc5fa789-af12-4d5e-b77c-be604ffc1a5d","resolution":{"observed_at":"2026-08-03T14:24:21.308997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18510","last_updated":"2024-06-26T17:31:22Z","snapshot_observed_at":"2026-08-15T16:44:03.149805Z","submitted_at":"2024-06-26T17:31:22Z","title":"WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18510","snapshot_observed_at":"2026-08-03T14:24:21.473425Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.473425Z"},"links":{"cited_paper":"/paper/2406.18510","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:77a335c60844f4e7250906311299f3b5472dde5a80eb81b8c010b84df532c36c","observation_id":"fa270477-3fe6-43ad-9f0a-efc5bdcd085e","resolution":{"observed_at":"2026-08-03T14:24:21.473425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-13T16:25:50.683520Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-08-03T14:24:21.679930Z","title":"Bridging offline and online reinforcement learning for llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.679930Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:3d7be7a08e2580074ec6068e5a2c98990a39672a3d7442e389744eb5f9c022b9","observation_id":"202772d5-4b27-4529-a7b7-41fb2b972c45","resolution":{"observed_at":"2026-08-03T14:24:21.679930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15623","last_updated":"2024-12-20T07:29:10Z","snapshot_observed_at":"2026-08-15T03:49:32.833889Z","submitted_at":"2024-12-20T07:29:10Z","title":"JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15623","snapshot_observed_at":"2026-08-03T14:24:21.893602Z","title":"Jailpo: A novel black-box jailbreak framework via preference optimization against aligned llms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:21.893602Z"},"links":{"cited_paper":"/paper/2412.15623","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:19081bd5466588548f5defdd5d8931101f845b1759c26f4a7d3900c7c9500f04","observation_id":"050f4c5c-0847-4f91-a0ba-2f68a0cbc320","resolution":{"observed_at":"2026-08-03T14:24:21.893602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:22.126595Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:22.126595Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:c933abd3326a039bd05801743357f94da901a04713791f673e715feb0067c37e","observation_id":"86002d33-4fed-440d-a4e8-47d7e30f9c91","resolution":{"observed_at":"2026-08-03T14:24:22.126595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-03T14:24:22.304412Z","title":"Truthfulqa: Measuring how models mimic human falsehoods, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:22.304412Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:c4b2a8816167f708aa7301157ba3478514afcf920de567b890a7f6c11d146d7c","observation_id":"3b27e5fa-d2b2-4718-a468-56ce1e93c334","resolution":{"observed_at":"2026-08-03T14:24:22.304412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-08-03T14:24:22.502308Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:22.502308Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:2a22bac8e0d94c60735f3e86b99becfdb69e96383b1db26a099236131bcb7a98","observation_id":"3ce5c752-b121-4c84-817f-6ad9d19affd0","resolution":{"observed_at":"2026-08-03T14:24:22.502308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-03T14:24:22.672881Z","title":"Understanding r1-zero-like training: A critical perspective, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:22.672881Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:d93e668ff75ab80634c556c9ba2943e0a846b1ad15694db748671fc79b3c1873","observation_id":"bf4cb70e-cc03-4976-aef8-b663943f47a1","resolution":{"observed_at":"2026-08-03T14:24:22.672881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00322","last_updated":"2024-07-28T09:39:01Z","snapshot_observed_at":"2026-08-13T10:00:58.452426Z","submitted_at":"2023-09-30T09:35:50Z","title":"Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00322","snapshot_observed_at":"2026-08-03T14:24:22.866024Z","title":"Evolving diverse red-team language models in multi-round multi-agent games, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:22.866024Z"},"links":{"cited_paper":"/paper/2310.00322","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:8f828e2930b26a9662cc550ec9b77736c5f82b1b6775f6cddc15ea3b19de1630","observation_id":"bd839b38-c599-44f5-be17-1564713659d1","resolution":{"observed_at":"2026-08-03T14:24:22.866024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:23.045786Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.045786Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:313ed842cef7be7d581e92f26510287828d36317f3f6fc23c7ee459d06aac36a","observation_id":"7034fb6b-576a-4fbe-9836-755f939fb788","resolution":{"observed_at":"2026-08-03T14:24:23.045786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:23.137102Z","title":"Harmbench github repository","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.137102Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:1e4a5ad7e9c03045d361a97d9eab5ce9e669e8ef0338567aa672ae6ee90678bf","observation_id":"0c38e4bf-ce34-43f7-b9f4-567a9ff16f85","resolution":{"observed_at":"2026-08-03T14:24:23.137102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:23.231764Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.231764Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:2d334d4ea813ff75d63f4c818ccccb693e85a90a5042c11f442963975b659747","observation_id":"6e4e4bc8-6001-49e3-bef0-5d101fb6705f","resolution":{"observed_at":"2026-08-03T14:24:23.231764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-15T08:04:16.784556Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-03T14:24:23.335344Z","title":"Anderson, Yaron Singer, and Amin Karbasi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.335344Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:ad92c960ff70a0af7f179bcb2178705f9cd4b2aeb8855bc7e0953979c4e07667","observation_id":"2a60e2d0-57c5-4174-b728-1da098c41e4e","resolution":{"observed_at":"2026-08-03T14:24:23.335344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T14:24:23.412067Z","title":"The llama 3 herd of models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.412067Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:11e3874e643b88f2311bad8b0872aa23287261a224ca909784d4ce2086abb6ca","observation_id":"15e3c58f-85c6-4ec0-8879-505bb1053d42","resolution":{"observed_at":"2026-08-03T14:24:23.412067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:23.506201Z","title":"Model Card - Prompt Guard","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.506201Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:dcbc269b16f4c407612dd17326747bb9a5bd9083de89f8d6ef2cef2d81683549","observation_id":"279421bc-c660-4d90-8c4e-9ea37f1a6d0d","resolution":{"observed_at":"2026-08-03T14:24:23.506201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-08-13T05:12:12.105399Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-03T14:24:23.615297Z","title":"Mankowitz, Doina Precup, and Bilal Piot","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.615297Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:afb147f86407a280280bd58a144424305372b81e53388c2353f689bbc35f26d7","observation_id":"e1af94db-53b0-4dd8-9598-0ae13b266a4f","resolution":{"observed_at":"2026-08-03T14:24:23.615297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:23.698021Z","title":null,"venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.698021Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:1ca73d5a68f04f6500d4fb8d690a7a5b26f95d2dfbb34a87a5cb420af180b5a6","observation_id":"2effc27a-376d-4393-bc1d-98135915b902","resolution":{"observed_at":"2026-08-03T14:24:23.698021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:23.829322Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.829322Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:aceb8f9ec9e2f04f18b6737b6e807068275e13ad02c50dfa820e8af99b30eb7b","observation_id":"83d3740f-98b2-4511-8301-36e340544399","resolution":{"observed_at":"2026-08-03T14:24:23.829322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:23.902182Z","title":"A dv P rompter: Fast adaptive adversarial prompting for LLM s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.902182Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:360552cf06085f0b137aecd9fcd14ed75aaf4347c60fc719198e43610e62546d","observation_id":"6fa5d27a-5894-4e1d-9bd3-3b94f81e319d","resolution":{"observed_at":"2026-08-03T14:24:23.902182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01606","last_updated":"2024-10-02T14:47:05Z","snapshot_observed_at":"2026-08-12T22:32:29.046663Z","submitted_at":"2024-10-02T14:47:05Z","title":"Automated Red Teaming with GOAT: the Generative Offensive Agent Tester","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01606","snapshot_observed_at":"2026-08-03T14:24:23.978444Z","title":"Automated red teaming with goat: the generative offensive agent tester, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.978444Z"},"links":{"cited_paper":"/paper/2410.01606","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:aef23f48b2bd0b78d1f648f9a089e80c539d4b588c6a3ec1a282278a1eadf963","observation_id":"15d0078a-55f8-4028-b665-4ec624028892","resolution":{"observed_at":"2026-08-03T14:24:23.978444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:24.065225Z","title":"Generalizing verifiable instruction following, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.065225Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:7d3d2e02f9c6d5bf58fe81fd5642e9cfabd6141f37e7eff17342872a5c9da04f","observation_id":"0c0649af-e0e3-43a1-ba0e-b0f32b4b3ccf","resolution":{"observed_at":"2026-08-03T14:24:24.065225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T14:24:24.145631Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.145631Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:22dee364611015822015a266526c96340107125025cc9a4c37b7db5f21decaeb","observation_id":"3d31b2b0-8037-4d2a-830c-320ce4d78d93","resolution":{"observed_at":"2026-08-03T14:24:24.145631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22160","last_updated":"2025-07-29T18:46:56Z","snapshot_observed_at":"2026-08-15T23:30:43.565131Z","submitted_at":"2025-07-29T18:46:56Z","title":"Strategic Deflection: Defending LLMs from Logit Manipulation","version":1},"cited_work":{"arxiv_id":"2507.22160","doi":"10.48550/arxiv.2507.22160","metadata_source":"pith","pith_arxiv_id":"2507.22160","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Strategic Deflection: Defending LLMs from Logit Manipulation","venue":"cs.CR","work_id":"3e430440-ed08-4c9e-b10c-335c080d6bde","year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.267269Z"},"links":{"cited_paper":"/paper/2507.22160","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:37aaa02c468827bb5157e781cdd1f8f6e3334fb45e30b7ddad3e837c4e13c856","observation_id":"6555fb52-5a81-4d7c-a31d-47c9eba147db","resolution":{"observed_at":"2026-08-03T14:29:07.776313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-03T14:24:24.358181Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.358181Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:531cc2436b514370576e3a75b929d0bf999989676b2a28141d7398a5b3264fae","observation_id":"39484ea9-6726-4041-a27d-55a23646f0d6","resolution":{"observed_at":"2026-08-03T14:24:24.358181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-14T04:19:38.572552Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-03T14:24:24.412524Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.412524Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:3301004c4e24c5bdaa8c525ec1df62852916450a8234a5883d082ecbbce21654","observation_id":"63e63eba-5b2e-4105-a100-7d8781f04cdb","resolution":{"observed_at":"2026-08-03T14:24:24.412524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T14:24:24.506084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.506084Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:88bfa1e66d62c6e24f3beee59916d24a4d224d6edccfb5bed6f62098c621f6e0","observation_id":"09d4a3a3-9da1-468d-b49b-36244ac89e6e","resolution":{"observed_at":"2026-08-03T14:24:24.506084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:24.669188Z","title":"``Do Anything Now'': Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.669188Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:4b9510cffe67f436a2fe55b0d78a442fd508656b26c73b8a59880f18d4a177fb","observation_id":"4860f30f-d90c-46c3-8088-98ae623440ee","resolution":{"observed_at":"2026-08-03T14:24:24.669188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-14T20:06:37.819179Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-03T14:24:24.762257Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.762257Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:7c34cd843cb2d6c5ef269ce19bacdc82d4a6cad1e1c47ef018dfbaf646f093d4","observation_id":"2e6e7293-f947-406f-81aa-c91cd60daeb6","resolution":{"observed_at":"2026-08-03T14:24:24.762257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:24.897317Z","title":"On general minimax theorems","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:24.897317Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:1e31ae9eab65b69c57931e5f18586b6192603ec89a0fb5ead4bdfe97733bb86f","observation_id":"517f4396-9557-4299-904e-761cabb57889","resolution":{"observed_at":"2026-08-03T14:24:24.897317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-03T14:24:25.064399Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:25.064399Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:6ba3ca2d47900cc677d49e8cfadfdfc8b622286a92e37ba3032b5353066243f7","observation_id":"3f983cde-fb04-4c61-8090-0c03e82e9597","resolution":{"observed_at":"2026-08-03T14:24:25.064399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:24:25.253356Z","title":"Rl is a hammer and llms are nails: A simple reinforcement learning recipe for strong prompt injection, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:25.253356Z"},"links":{"citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:627d279ec7114041f0007e2e9693ce5ffc31d62b8bf4a1db18a057b6f6d8e0de","observation_id":"e8a4db2b-d7e7-4e60-9781-7209a11ba1b1","resolution":{"observed_at":"2026-08-03T14:24:25.253356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-08-13T00:17:27.395385Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-03T14:24:25.355700Z","title":"Self-play preference optimization for language model alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:25.355700Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:ebc6543073ac5a2bfc650784fbf2424692d64195e7bafcc7b5cf4b8cba5b15db","observation_id":"d17e2fce-c79d-4104-9613-1feaf1273f8d","resolution":{"observed_at":"2026-08-03T14:24:25.355700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08240","last_updated":"2026-04-20T18:30:25Z","snapshot_observed_at":"2026-08-13T23:59:52.814838Z","submitted_at":"2025-10-09T14:03:05Z","title":"The Alignment Waltz: Jointly Training Agents to Collaborate for Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08240","snapshot_observed_at":"2026-08-03T14:24:25.516726Z","title":"The alignment waltz: Jointly training agents to collaborate for safety, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:25.516726Z"},"links":{"cited_paper":"/paper/2510.08240","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:6b0225a44f15973a85cad4356095f601b89bf9039b24c1012d4778826ca78083","observation_id":"88d877aa-a2ce-4090-bc42-e5d16d31ad17","resolution":{"observed_at":"2026-08-03T14:24:25.516726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16852","last_updated":"2025-02-24T05:24:52Z","snapshot_observed_at":"2026-08-07T17:54:16.806953Z","submitted_at":"2025-02-24T05:24:52Z","title":"Improving LLM General Preference Alignment via Optimistic Online Mirror Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16852","snapshot_observed_at":"2026-08-03T14:24:25.789502Z","title":"Improving llm general preference alignment via optimistic online mirror descent, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:25.789502Z"},"links":{"cited_paper":"/paper/2502.16852","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:3b304e6da873ff45ec9d3a33a32608d9ed7d4e496435901ecc3772af3476331a","observation_id":"644bbec5-543a-4555-819a-4c4ca0d16576","resolution":{"observed_at":"2026-08-03T14:24:25.789502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-08-11T20:12:00.210052Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-03T14:24:25.902197Z","title":"Absolute zero: Reinforced self-play reasoning with zero data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:25.902197Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:c153c25504e48232c54e323c767a96ca12f6f4f6550103eab8d70b2986183317","observation_id":"7ac1433e-488e-4844-b5b9-cc8d9c67cb84","resolution":{"observed_at":"2026-08-03T14:24:25.902197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-03T14:24:26.027983Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:26.027983Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:32caaaf1fb5751b3dac47294a55e27553bfa16bf97533dd510e0d82d921ba929","observation_id":"c686451d-1ddf-4bdf-8e63-ff72c94314b6","resolution":{"observed_at":"2026-08-03T14:24:26.027983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T19:44:13.857693Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2512.20806."}