{"as_of":"2026-08-07T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a6f2725f24cca9a261ffb0d6385cda6576233f4b4283d00b687472045b536dd","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:41:58.270264Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:39:07.051052Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:58:57.626705Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":"2506.07468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-07-07T03:18:47.218133Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models","venue":null,"work_id":"cc015c9a-bf61-4c41-bb65-02bc0a21b9ec","year":2025},"citing_paper":{"arxiv_id":"2504.09006","last_updated":"2026-05-15T17:00:55Z","snapshot_observed_at":"2026-07-06T21:08:14.728342Z","submitted_at":"2025-04-11T23:14:32Z","title":"Learning in Structured Stackelberg Games","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T21:19:07.958963Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2504.09006"},"observation_digest":"sha256:5632c0eea5482548edc90eeb9f117cd4cbd719c9939134408b534011e5d86541","observation_id":"0122cf54-546d-493c-bbdb-139728a28dcf","resolution":{"observed_at":"2026-07-07T03:18:47.218133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-08-05T10:39:07.051052Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-06T11:50:02.157285Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:07.051052Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:cc10877ed8e04128c5deab14b0a0f6bc3af2dbea004ab69cb9d4cd8aa7718b44","observation_id":"87fb0fde-85a3-444f-bd59-22107d08e435","resolution":{"observed_at":"2026-08-05T10:39:07.051052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-08-03T14:24:22.502308Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-06T07:38:24.259000Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:22.502308Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:90774f58dceea34ed75b78e86eebdd9c61d0bb847d7a49e6e5ca9e100e077e69","observation_id":"3ce5c752-b121-4c84-817f-6ad9d19affd0","resolution":{"observed_at":"2026-08-03T14:24:22.502308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-08-02T23:43:07.037472Z","title":"org/CorpusID:237532606","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.037472Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:87f021def5f21b1fba0c29089578cb7eca93512a230d27391f7ffa8e7f8bbb42","observation_id":"5cf49950-f877-4f14-98ac-021460384fb4","resolution":{"observed_at":"2026-08-02T23:43:07.037472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":"2506.07468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-07-07T03:18:47.218133Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models","venue":null,"work_id":"cc015c9a-bf61-4c41-bb65-02bc0a21b9ec","year":2025},"citing_paper":{"arxiv_id":"2604.24020","last_updated":"2026-04-27T04:09:27Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T04:09:27Z","title":"Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:16.838064Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2604.24020"},"observation_digest":"sha256:45f994ec74db9ba0b8bb5351988297b20f568ea5e8c2657437ec1b8519687e89","observation_id":"49079c01-45c4-4303-b942-dd408376f364","resolution":{"observed_at":"2026-07-07T03:18:47.218133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":"2506.07468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-07-07T03:18:47.218133Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models","venue":null,"work_id":"cc015c9a-bf61-4c41-bb65-02bc0a21b9ec","year":2025},"citing_paper":{"arxiv_id":"2605.01899","last_updated":"2026-05-03T14:28:08Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:28:08Z","title":"Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T17:24:54.796037Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2605.01899"},"observation_digest":"sha256:ae0474c509bc364c9a91968514a5eefbeec463b1598b7f603a10d82849cd398b","observation_id":"971b4905-a101-4658-8b8c-00ce6d42e8fd","resolution":{"observed_at":"2026-07-07T03:18:47.218133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":"2506.07468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-07-07T03:18:47.218133Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models","venue":null,"work_id":"cc015c9a-bf61-4c41-bb65-02bc0a21b9ec","year":2025},"citing_paper":{"arxiv_id":"2605.08427","last_updated":"2026-05-08T19:41:59Z","snapshot_observed_at":"2026-08-03T19:22:23.970331Z","submitted_at":"2026-05-08T19:41:59Z","title":"The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:44.093659Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2605.08427"},"observation_digest":"sha256:991ad595909c8861bd6178752c1bf247e701dd8fc7f2674e496416ef0ac4b426","observation_id":"34ccd0d5-654f-4dd5-aff8-f4f4b8adbc6e","resolution":{"observed_at":"2026-07-07T03:18:47.218133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":"2506.07468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-07-07T03:18:47.218133Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models","venue":null,"work_id":"cc015c9a-bf61-4c41-bb65-02bc0a21b9ec","year":2025},"citing_paper":{"arxiv_id":"2606.17657","last_updated":"2026-06-16T08:16:17Z","snapshot_observed_at":"2026-08-05T08:43:46.082620Z","submitted_at":"2026-06-16T08:16:17Z","title":"Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T01:03:49.101568Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2606.17657"},"observation_digest":"sha256:dbf948e2beca09dd0d59f1fd869bbe0bfc341a1291d60a80afcb0ed83a4d0c76","observation_id":"b6e96ab9-4f73-44ad-865a-c8da413936cf","resolution":{"observed_at":"2026-07-07T03:18:47.218133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":"2506.07468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-07-07T03:18:47.218133Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models","venue":null,"work_id":"cc015c9a-bf61-4c41-bb65-02bc0a21b9ec","year":2025},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:3f3772286f0bbbb429e510f91b9029eadce1ce6d26e2434cae4774e2020f0299","observation_id":"f2d594ef-34e0-4153-be32-593cc41954b0","resolution":{"observed_at":"2026-07-07T03:18:47.218133Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07468/citation-record","integrity":"/paper/2506.07468/integrity","json":"/paper/2506.07468/citation-record.json","paper":"/paper/2506.07468"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:41:57.833620Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.833620Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:0d3eece86f2682b1a94a201eafc08b77f1c703b7aef07e5dfc70a4cc73fa7e19","observation_id":"7d261ee4-5244-4b40-9872-858655a6dbdf","resolution":{"observed_at":"2026-08-07T05:41:57.833620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.839478Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.839478Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:c6fdfbc6ae786cf1d14f18d499929a9ccf26dded13db941461f468d284495715","observation_id":"11699782-5518-422b-a26d-43cb5a3b2d4f","resolution":{"observed_at":"2026-08-07T05:41:57.839478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T05:41:57.844270Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.844270Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:a935ad3ad47a341ca0ba6a2f56a14d10abb0951f65cfc4356ea102afc068287d","observation_id":"276d90cd-b58e-4a68-9377-9ae5c08dc941","resolution":{"observed_at":"2026-08-07T05:41:57.844270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.849623Z","title":"Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.849623Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:b4ed5ac2da0e1627e1a281311b8439c956744d7d54ba7022837eea7c53e84208","observation_id":"cf27c3fe-c28b-4318-809e-1aff70e2ef3d","resolution":{"observed_at":"2026-08-07T05:41:57.849623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.854313Z","title":"Explore, establish, exploit: Red teaming language models from scratch, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.854313Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:16928945e2336415b4994c83c4ff88d4088806bb1840b33885527b7c1320e43a","observation_id":"238d1b8e-68dc-460b-a349-73820b167a38","resolution":{"observed_at":"2026-08-07T05:41:57.854313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08115","last_updated":"2025-02-18T12:50:00Z","snapshot_observed_at":"2026-08-06T21:09:09.996403Z","submitted_at":"2024-10-10T17:00:06Z","title":"Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08115","snapshot_observed_at":"2026-08-07T05:41:57.859038Z","title":"Optima: Optimizing effectiveness and efficiency for llm-based multi-agent system, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.859038Z"},"links":{"cited_paper":"/paper/2410.08115","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:d1e6a3e53cfa8aae2e819439e12b6cb1de5a2fe2ad6ff9cb9fd67d28cb4b7cc2","observation_id":"bd4d2d05-6319-4083-a92a-ae9082dbd620","resolution":{"observed_at":"2026-08-07T05:41:57.859038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-07T05:41:57.864889Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.864889Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:233716ebe9fe03863755b229436b42a222399f90db9a1f331836df314e7591c0","observation_id":"e9f41345-bd26-4ffa-ba8e-c90e1c5864d1","resolution":{"observed_at":"2026-08-07T05:41:57.864889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10642","last_updated":"2025-01-24T15:21:47Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:16:22Z","title":"Self-playing Adversarial Language Game Enhances LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10642","snapshot_observed_at":"2026-08-07T05:41:57.869806Z","title":"Self-playing adversarial language game enhances llm reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.869806Z"},"links":{"cited_paper":"/paper/2404.10642","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:992a66f3456f5018fc6aee23a3dc97409b71adcc138d1718751a65eb7aa9fcd6","observation_id":"f3a95e10-5b87-43bc-8a9e-6e6fe8e47765","resolution":{"observed_at":"2026-08-07T05:41:57.869806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T05:41:57.874726Z","title":"Think you have solved question answering? try ARC , the AI2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.874726Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:8a5ecb7505d7c5db9c830cdb30466578c91d067be86df9c776cbae12a5ba3618","observation_id":"736cc6d9-6aba-4426-8e5f-cc9747cf4850","resolution":{"observed_at":"2026-08-07T05:41:57.874726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.879647Z","title":"Or-bench: An over-refusal benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.879647Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:b81f2860c2936205dc079963f8800d28a1bd1c933a2cd61aed8dee0257e6c04b","observation_id":"ec01d375-b3e0-4d45-9f75-b2c8ae63ffbb","resolution":{"observed_at":"2026-08-07T05:41:57.879647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.884214Z","title":"Safe rlhf: Safe reinforcement learning from human feedback, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.884214Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:eef35799374694649c3a219018691c878cb17986e0a631becb45ce3293a36a4e","observation_id":"80d2ced1-f453-47ee-84d7-3cd18e1ccd69","resolution":{"observed_at":"2026-08-07T05:41:57.884214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.888900Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.888900Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:48cb3a1f0324e54d9fb47aab9e3bc7c2994846419a9cac6d920cf29ef9a44d5a","observation_id":"31038389-1278-4256-9c39-f2b57d92a12a","resolution":{"observed_at":"2026-08-07T05:41:57.888900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.893347Z","title":"Duoguard: A two-player rl-driven framework for multilingual llm guardrails, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.893347Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:eaf3f7580c0e87595e29f0fd1e56660350513cebca3bbb3de01987359d582712","observation_id":"25554758-1d74-4ad9-9ddf-13007b966ef8","resolution":{"observed_at":"2026-08-07T05:41:57.893347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.898130Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.898130Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:616a30395ba6d4661168f84db0879a6cc5d8d3b97a4bbe32f9cd66bbf7e950bd","observation_id":"9ff7b10b-9387-4878-8504-4fd80aff043d","resolution":{"observed_at":"2026-08-07T05:41:57.898130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-04T06:46:45.395897Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T05:41:57.903053Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.903053Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:d6e46b886342668cd214cde83a488df1c758ac4549df993c622b8f725c23dc68","observation_id":"a5c22db3-0a74-4d65-bb86-117c9fd7719e","resolution":{"observed_at":"2026-08-07T05:41:57.903053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.578115Z","title":"Google’s gemini tops apple’s app store, snagging lead spot from chatgpt","venue":null,"work_id":"83326c8f-b4db-46b8-afac-89edd03336e8","year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.907741Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:13d8fdb4815dfd7d2855c3a3f767c8c369359e14915e519abadbf247acb1432f","observation_id":"bbe488b0-2f52-4006-8f78-4dd7352411af","resolution":{"observed_at":"2026-08-07T05:41:59.582649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T05:41:57.912354Z","title":"Kto: Model alignment as prospect theoretic optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.912354Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:c3090dccdc94eaa3ff5b30bba1817f239f23e6cf56d436b0bdb76c383e63ba7a","observation_id":"7a3b73d6-2d97-483a-91cb-3a0eaf190491","resolution":{"observed_at":"2026-08-07T05:41:57.912354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T05:41:57.917162Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.917162Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:12591292dd3111da4939c1d79c63e357f5816645ca40f83fd5d7af8846c8aef4","observation_id":"001aecab-5aa4-466b-a62a-e2ca9896332f","resolution":{"observed_at":"2026-08-07T05:41:57.917162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.563563Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022 b","venue":null,"work_id":"2fffa4dc-f206-44e7-9451-b02c3e40be23","year":2022},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.921874Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:62510390cf0b487f785ca499f53b87bcea1ee46b37c5666a19bceb7c93407ea6","observation_id":"7e55409a-7862-43c4-a474-62ce901c1d23","resolution":{"observed_at":"2026-08-07T05:41:59.568608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.927089Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.927089Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:0632fb8d5933d53b40ee91011c465e0b7d71214b612333afbd9e7f911ebe79dc","observation_id":"627da4da-6f88-49d2-a020-11ff4cd4daf7","resolution":{"observed_at":"2026-08-07T05:41:57.927089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08446","last_updated":"2025-02-11T18:59:26Z","snapshot_observed_at":"2026-08-06T16:31:19.141189Z","submitted_at":"2024-06-12T17:37:09Z","title":"OLMES: A Standard for Language Model Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08446","snapshot_observed_at":"2026-08-07T05:41:57.931539Z","title":"Olmes: A standard for language model evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.931539Z"},"links":{"cited_paper":"/paper/2406.08446","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:bfb2925ee256b999171b92a0b868298344b45e0db4de4b573832b7b9c51dc0a4","observation_id":"b5b39e20-9c79-4cd0-a001-af7ac9eb3b26","resolution":{"observed_at":"2026-08-07T05:41:57.931539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.548947Z","title":"Elon musk's ai chatbot, grok, started calling itself 'mechahitler'","venue":null,"work_id":"3777a85f-363d-47b0-a554-34e79881142f","year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.941178Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:bc32c829a5228fc6fcdc9266863afbd1a33170e5c623e3964a35107ab190ee10","observation_id":"b8bf5e3e-c1d6-42f1-9ee3-0344a4c82260","resolution":{"observed_at":"2026-08-07T05:41:59.553774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-06T04:32:59.039501Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-08-07T05:41:57.945774Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.945774Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:9c3e64a305332e6f497e8d6de8e58a9e746e76a37c52f674efdb77de5458b45f","observation_id":"612acdc7-9ce5-4332-9223-b0c6a5c688af","resolution":{"observed_at":"2026-08-07T05:41:57.945774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T05:41:57.950270Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.950270Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:170f4f8386442d7ec14740a009509f843c707758ab91034dc79934d31066acd1","observation_id":"911dc80a-16f0-44d0-91ff-8f92c15b148e","resolution":{"observed_at":"2026-08-07T05:41:57.950270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19464","last_updated":"2024-02-29T18:55:03Z","snapshot_observed_at":"2026-08-04T22:49:54.802240Z","submitted_at":"2024-02-29T18:55:03Z","title":"Curiosity-driven Red-teaming for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19464","snapshot_observed_at":"2026-08-07T05:41:57.954768Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.954768Z"},"links":{"cited_paper":"/paper/2402.19464","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:2ed810261e1a99a0fa81513a54dfe82a9d93c0952625a3e9dcafc2a0ee82a4ad","observation_id":"8e9e53ba-eaf1-4794-8499-e0c016149cf6","resolution":{"observed_at":"2026-08-07T05:41:57.954768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18213","last_updated":"2025-06-05T08:11:43Z","snapshot_observed_at":"2026-08-06T20:29:52.745778Z","submitted_at":"2024-07-25T17:26:41Z","title":"Scaling Trends in Language Model Robustness","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18213","snapshot_observed_at":"2026-08-07T05:41:57.959395Z","title":"Scaling trends in language model robustness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.959395Z"},"links":{"cited_paper":"/paper/2407.18213","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:18563cf36748e1d2b01a8d36404ac39c0aa4124fc95fdf9f9d5786ed1e09c60e","observation_id":"8c906f45-c952-4d92-92d0-cca9c9943bc3","resolution":{"observed_at":"2026-08-07T05:41:57.959395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T05:41:57.964115Z","title":"Reinforce++: An efficient rlhf algorithm with robustness to both prompt and reward models, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.964115Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:3148f6402971388ad8dd1e63e863cb8b0d4481629e7de44108fd3bb931427fce","observation_id":"c832e925-7b0f-4213-a087-17c664d4a33e","resolution":{"observed_at":"2026-08-07T05:41:57.964115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T05:41:57.968902Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.968902Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:0f488d10de38cf448126db6a5e733fec9dae00c64aedb13de9df0de014b54219","observation_id":"400b3502-a835-44db-b926-b07dbdb40fa6","resolution":{"observed_at":"2026-08-07T05:41:57.968902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.973759Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.973759Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:e5f593d648869a1fe2dbfdc450bbc8ce496515b5f61b3ab1d3ffced2c6b465a3","observation_id":"6135fdf7-8acb-41c6-9e3d-450ef74083c6","resolution":{"observed_at":"2026-08-07T05:41:57.973759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-07T05:41:57.978623Z","title":"Baseline defenses for adversarial attacks against aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.978623Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:9fbabc0f43520e9e8d444e2d29a4cbaff5fc2fe7372b902dc1f2fa802675b458","observation_id":"c8c0d244-4ce6-4ab2-9651-e07ad646e999","resolution":{"observed_at":"2026-08-07T05:41:57.978623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.525441Z","title":"Sequence tutor: Conservative fine-tuning of sequence generation models with kl-control","venue":null,"work_id":"35deb34d-f410-4937-ab15-c466082fa4c7","year":2017},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.983647Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:7ce7f072d151de6eff87442de30cd4ac4e76b36af87bdd88588d59f0ebbcf8cc","observation_id":"1d4631da-3dbf-4b81-a8e2-0ebaa6f6f048","resolution":{"observed_at":"2026-08-07T05:41:59.529827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-07T05:41:57.988453Z","title":"Way off-policy batch deep reinforcement learning of implicit human preferences in dialog","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.988453Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:771f26bca19c5e475e99e33103635796cf92daf3c2bfa3f3192bfc557c0543a3","observation_id":"3283b948-1bed-4db5-863a-4b3704b0b63e","resolution":{"observed_at":"2026-08-07T05:41:57.988453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:57.993791Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.993791Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:3ad923a7e7f46331e13b27f714b7d9314baa422fb233e7192caa3a5506277b20","observation_id":"68d765d4-6336-4559-a5e8-5a5249849e36","resolution":{"observed_at":"2026-08-07T05:41:57.993791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.502357Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models","venue":null,"work_id":"851059d4-ff6c-4178-8da8-34c07f0bc147","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:57.998312Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:f319f3b5d4320eda3d62997efdc213b5f33c61f88fa713c4da45cfb3300a8072","observation_id":"d7939376-e6bb-4e6a-8b88-1260bd1d7db8","resolution":{"observed_at":"2026-08-07T05:41:59.506744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.488817Z","title":"Predicting vs","venue":null,"work_id":"4902e368-05b3-4ed6-9973-402a7b5d1e92","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.002907Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:60e779930fefbca8bf2492d80ab412b70caa7ef466d72e5fc9fc44764a276265","observation_id":"ac29a75d-8bcc-4624-9b9f-dc96c0929b45","resolution":{"observed_at":"2026-08-07T05:41:59.492900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.475464Z","title":"Deepinception: Hypnotize large language model to be jailbreaker, 2024 b","venue":null,"work_id":"ecbf2561-a428-4d88-83e8-fab88e3c17b4","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.007546Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:a697e10d9cabb15fd59d141a13e080fb04f6244497231a5ecba8d145a69a94ed","observation_id":"72fc32e3-f478-45f8-be3d-41168b4fac42","resolution":{"observed_at":"2026-08-07T05:41:59.479736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.461618Z","title":"Hashimoto","venue":null,"work_id":"663c9233-fe93-496f-b345-997957ef047e","year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.012180Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:3f9ad475f906f2f0ffdfd426af0278c9eebfbadce87d5f718f54c21677b6485c","observation_id":"4d5ff083-06ec-4d68-84e3-62399fafd648","resolution":{"observed_at":"2026-08-07T05:41:59.466162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16129","last_updated":"2026-05-30T09:48:39Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-21T07:03:54Z","title":"MARFT: Multi-Agent Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16129","snapshot_observed_at":"2026-08-07T05:41:58.017209Z","title":"Marft: Multi-agent reinforcement fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.017209Z"},"links":{"cited_paper":"/paper/2504.16129","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:f843858de4f109af2c949cb7d05f4c9ab66adf9fa871aacca8b21dd54ef59f0c","observation_id":"11df9874-f606-47d4-b944-f2b6b3ae4a03","resolution":{"observed_at":"2026-08-07T05:41:58.017209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.022458Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.022458Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:6c572f6b4356339e1e8979742660b8583f234a45a84563925af4d28a72e529c2","observation_id":"45c214d2-fdcb-40ae-a871-f0bc9fa452ad","resolution":{"observed_at":"2026-08-07T05:41:58.022458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T05:41:58.027258Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.027258Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:f6906c6e796b0d5fb6278f0c580bf41e7cc79becffda47b64df60f24c27b6689","observation_id":"b3b15b35-152e-4027-8720-41b22493dde3","resolution":{"observed_at":"2026-08-07T05:41:58.027258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00322","last_updated":"2024-07-28T09:39:01Z","snapshot_observed_at":"2026-08-06T08:21:44.582674Z","submitted_at":"2023-09-30T09:35:50Z","title":"Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00322","snapshot_observed_at":"2026-08-07T05:41:58.032351Z","title":"Evolving diverse red-team language models in multi-round multi-agent games, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.032351Z"},"links":{"cited_paper":"/paper/2310.00322","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:d97cef668435c8b8d9c70ddad94ee849a6db03788cb4845820531cac7f92c580","observation_id":"0dbae9cc-0219-4840-a4df-cde030eb9e45","resolution":{"observed_at":"2026-08-07T05:41:58.032351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.437936Z","title":"Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning","venue":null,"work_id":"eaeaae69-4598-4a7b-85cd-8401f563e2a8","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.037273Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:42ae1893f6b6860d98fd1aacda69c299cc7e17a03c0db562497ac164cd3e7ed3","observation_id":"9c929570-bff5-4ab6-a133-54b36f7a951f","resolution":{"observed_at":"2026-08-07T05:41:59.442470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.041850Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.041850Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:c4b9e3db4ed5afd907f433610e382fc82527992a72c8fd6a2d6ae0f27b73a0e4","observation_id":"12d4ecb8-0176-444b-a1e8-50d3080f3aae","resolution":{"observed_at":"2026-08-07T05:41:58.041850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.046382Z","title":"Tree of attacks: Jailbreaking black-box llms automatically, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.046382Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:f796954d04dd9fe51b57e507bced4f9d57c3cd06ef89d8dfc09df22b7f57114d","observation_id":"1c4ffa3c-d4dd-43d9-893d-b34d50776a08","resolution":{"observed_at":"2026-08-07T05:41:58.046382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04373","last_updated":"2023-10-10T15:01:11Z","snapshot_observed_at":"2026-08-03T12:56:26.490744Z","submitted_at":"2023-10-06T16:59:17Z","title":"Confronting Reward Model Overoptimization with Constrained RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04373","snapshot_observed_at":"2026-08-07T05:41:58.050861Z","title":"Confronting reward model overoptimization with constrained rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.050861Z"},"links":{"cited_paper":"/paper/2310.04373","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:eab0f6b43030de5a9d8c5b97e854fb0c96c4cc264e1357d10974beb4059afc2a","observation_id":"fbef0415-1371-4519-ac9b-cf890d9961a4","resolution":{"observed_at":"2026-08-07T05:41:58.050861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.404329Z","title":"Equilibrium points in n-person games","venue":null,"work_id":"78b20acf-b4a0-467c-886f-152a26b8c5b9","year":1950},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.055770Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:148efd591884465d411120c551bd2e09e8a92777700b8ae738dcf53208931907","observation_id":"11dc78f5-d5ff-4a48-acf5-c2a833370c82","resolution":{"observed_at":"2026-08-07T05:41:59.408665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.389666Z","title":"DAN (do anything now): A jailbreaking prompt technique, 2023","venue":null,"work_id":"b0c54c20-c5d4-4db4-a638-b42788af6874","year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.060615Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:60eda2c5182106fb00b311a977c55213ae829b15e60c95b3a16708bc90dde945","observation_id":"78b3e19f-3ea4-4b0a-9287-eeace28b5644","resolution":{"observed_at":"2026-08-07T05:41:59.394055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:41:58.065234Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.065234Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:27138a0848a380178ea6f6d62c5865dd0ff3c578b9df136faa63a803d259af38","observation_id":"f2b8332c-8bab-4803-a17e-9ec09b2f0463","resolution":{"observed_at":"2026-08-07T05:41:58.065234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.069914Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.069914Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:1c8ffb966f3f71a6b4b4e8d3f3cac5b02a30fcda1ca3d55081a72cfe5e6de7d4","observation_id":"799ca465-aabf-48c9-b93f-b6cff9914bb4","resolution":{"observed_at":"2026-08-07T05:41:58.069914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18439","last_updated":"2025-07-12T20:13:27Z","snapshot_observed_at":"2026-07-06T20:42:33.518153Z","submitted_at":"2025-02-25T18:33:48Z","title":"MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18439","snapshot_observed_at":"2026-08-07T05:41:58.074609Z","title":"Maporl: Multi-agent post-co-training for collaborative large language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.074609Z"},"links":{"cited_paper":"/paper/2502.18439","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:71f31ccaea8c1b890a6603214830edcf9d3b41357568f2a04497a1ba4384fed8","observation_id":"59f1180e-7ae6-4f72-bc1d-b3c437690746","resolution":{"observed_at":"2026-08-07T05:41:58.074609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-07T05:41:58.084007Z","title":"Red teaming language models with language models, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.084007Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:7b8a17426415a64363c3271d2d6d0959332dc18e31965944650be7c12ef2f1b5","observation_id":"3da9b7f8-e844-4f40-a316-4b4e72ebc973","resolution":{"observed_at":"2026-08-07T05:41:58.084007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T05:41:58.088585Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.088585Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:834ada6fd9c3476fa84000ef82b511062efc26e6f83e7e1215b7eac5793904af","observation_id":"39c0e848-ed86-4518-8e3b-27ff5d32088a","resolution":{"observed_at":"2026-08-07T05:41:58.088585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13203","last_updated":"2025-08-23T02:09:57Z","snapshot_observed_at":"2026-07-06T21:11:10.415720Z","submitted_at":"2025-04-15T16:11:28Z","title":"X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13203","snapshot_observed_at":"2026-08-07T05:41:58.098869Z","title":"X-teaming: Multi-turn jailbreaks and defenses with adaptive multi-agents, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.098869Z"},"links":{"cited_paper":"/paper/2504.13203","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:44452e814cab91f88765f2ff8906b7c52b405b654ea536b405d620f4d7b8ed58","observation_id":"318aa9e8-b1de-4ad9-8dc2-597ff52aa0f6","resolution":{"observed_at":"2026-08-07T05:41:58.098869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T05:41:58.103356Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.103356Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:8bbcfd359bb874625b1dd5d0af55070d8f1a190e5e86ed3e695c39357c11d99d","observation_id":"697dfc84-876c-4ae9-aa38-08e04f0e13de","resolution":{"observed_at":"2026-08-07T05:41:58.103356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T05:41:58.108249Z","title":"GPQA : A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.108249Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:5c767faf60c0e9898b29dc84d177bb36767602d4317450064d990d12eb157f36","observation_id":"e3652854-611a-4c51-a4c3-ef6bb6ab6981","resolution":{"observed_at":"2026-08-07T05:41:58.108249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.365900Z","title":"XST est: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":"929a5c5a-035e-4683-ba3b-49f826b9979f","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.113010Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:5dda471b76c1215801d2cd7dc8051808ba4a62453fa456f6b25120ca333ae0cc","observation_id":"23558116-2263-46ae-ac37-811de7a087f4","resolution":{"observed_at":"2026-08-07T05:41:59.370355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16822","last_updated":"2024-12-11T18:07:25Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:47:27Z","title":"Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16822","snapshot_observed_at":"2026-08-07T05:41:58.117338Z","title":"Markosyan, Manish Bhatt, Yuning Mao, Minqi Jiang, Jack Parker-Holder, Jakob Foerster, Tim Rocktäschel, and Roberta Raileanu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.117338Z"},"links":{"cited_paper":"/paper/2402.16822","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:d3d43fbfbf2daa92aff1867e243436ad021bc087fdb333ebdab201d44cd5f8b9","observation_id":"195be6b8-681c-42b3-8ed0-dd4c458f7a3a","resolution":{"observed_at":"2026-08-07T05:41:58.117338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06060","last_updated":"2025-02-09T22:44:45Z","snapshot_observed_at":"2026-07-06T20:33:39.014448Z","submitted_at":"2025-02-09T22:44:45Z","title":"Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06060","snapshot_observed_at":"2026-08-07T05:41:58.121890Z","title":"Training language models for social deduction with multi-agent reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.121890Z"},"links":{"cited_paper":"/paper/2502.06060","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:f78a3c8dabf8d87cfa3daa39e922dec6ff65fcc91aa377db00739ec34eba03e5","observation_id":"6ed57130-317f-43e1-add1-ca4c61bd1a67","resolution":{"observed_at":"2026-08-07T05:41:58.121890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.352265Z","title":"Google’s Gemini headaches spur \\ 90 billion selloff","venue":null,"work_id":"e3ace79f-f0ab-4cf4-b6e8-45a81ae4d815","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.126717Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:93729bef22a43828474362d4d301081b168641d38b909afde87bc5fe6d08d6ca","observation_id":"4705f74b-db8f-4a4e-be1d-db187af308b8","resolution":{"observed_at":"2026-08-07T05:41:59.356514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:41:58.131236Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.131236Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:364270fa7ecce41d5638724290db92520bee51d3eabd1c183675a434b46a21dc","observation_id":"6931b790-1272-4a6a-b1e2-5de808fc569b","resolution":{"observed_at":"2026-08-07T05:41:58.131236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:41:58.140834Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.140834Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:66f1eafde9c4266d02efcf0cd32a68dbddf96351271dceb657e6f5ad716e729e","observation_id":"e3d0b708-cbd7-48dd-bed7-1385abed1db6","resolution":{"observed_at":"2026-08-07T05:41:58.140834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-07T05:41:58.145271Z","title":"Latent adversarial training improves robustness to persistent harmful behaviors in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.145271Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:b5327d0af5f7c584f39dc76640a6d7016bf421d19507cf97a7a3ebea7a085b33","observation_id":"01fccca1-03f1-4526-a286-11d1c5afe604","resolution":{"observed_at":"2026-08-07T05:41:58.145271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.338227Z","title":"Ai effect openai’s chatgpt to hit 700 million weekly users, up 4x from last year","venue":null,"work_id":"491e0cae-c053-4366-b20a-7da45958e9eb","year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.150126Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:3b9f861639210bdb4bc3b08e6d46e9f0b7938fc1e6437fd26e5d9c15f82a94e9","observation_id":"248627d4-afb2-4c48-9b89-2d01ce445424","resolution":{"observed_at":"2026-08-07T05:41:59.342595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.323974Z","title":"A strongreject for empty jailbreaks","venue":null,"work_id":"8a221c66-4fbe-48e8-939e-ec2dfff78977","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.154578Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:fa49184f4a35805777059c3f2f9afcb0acef07d93fa10149318fd1e0c30cb612","observation_id":"1e2400ad-0e2c-4929-8496-50220b099551","resolution":{"observed_at":"2026-08-07T05:41:59.328396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05707","last_updated":"2025-03-03T18:58:16Z","snapshot_observed_at":"2026-07-06T20:19:02.999488Z","submitted_at":"2025-01-10T04:35:46Z","title":"Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05707","snapshot_observed_at":"2026-08-07T05:41:58.159431Z","title":"Multiagent finetuning: Self improvement with diverse reasoning chains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.159431Z"},"links":{"cited_paper":"/paper/2501.05707","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:020c2a3e2990abcaadda872b0799ef87bd6560364de781b5bde9455e98c18cf7","observation_id":"351222e8-1589-4ce1-9833-6a0d19e4e170","resolution":{"observed_at":"2026-08-07T05:41:58.159431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14367","last_updated":"2024-06-02T22:00:42Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:20:18Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14367","snapshot_observed_at":"2026-08-07T05:41:58.164616Z","title":"Preference fine-tuning of llms should leverage suboptimal, on-policy data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.164616Z"},"links":{"cited_paper":"/paper/2404.14367","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:1b3052a8fe3765e41d53f75885b502805cf8f53217e9382e7ff8e4318506e99c","observation_id":"eb2ab06e-0633-4105-852f-39b1eeade8a3","resolution":{"observed_at":"2026-08-07T05:41:58.164616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00030","last_updated":"2025-07-07T20:24:43Z","snapshot_observed_at":"2026-08-05T00:26:01.489992Z","submitted_at":"2025-02-24T22:43:21Z","title":"RSPO: Regularized Self-Play Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00030","snapshot_observed_at":"2026-08-07T05:41:58.169779Z","title":"Game-theoretic regularized self-play alignment of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.169779Z"},"links":{"cited_paper":"/paper/2503.00030","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:229b2e5dd6ae94ffc7d9b509707d8653ec9528b9e95e85a0163eb9833c435bd8","observation_id":"599bad6f-02f6-4358-84ad-e21cd6c4f3af","resolution":{"observed_at":"2026-08-07T05:41:58.169779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.174758Z","title":"Theory of games and economic behavior, 2nd rev","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.174758Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:a014b78f45caa1c58416c57755599b6580a1456d78e3ad4d607585a0346eac6a","observation_id":"674068a5-93ff-481c-b563-d1921219dbd9","resolution":{"observed_at":"2026-08-07T05:41:58.174758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.179620Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.179620Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:93adb68f0f7c89321bb8e66be1c202af3aa75cbe96304270f5a2516ba79f99d0","observation_id":"fc19154d-e67d-478e-ae7f-bfe09d439d4e","resolution":{"observed_at":"2026-08-07T05:41:58.179620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.184490Z","title":"Co-evolving llm coder and unit tester via reinforcement learning, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.184490Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:55696d63ddf19f24b9d47d3c023d33d226bf696e64694f77a3e4b03c04a4c8b1","observation_id":"ca722a10-4741-4f16-b0d7-6c0ed56a0c7f","resolution":{"observed_at":"2026-08-07T05:41:58.184490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-07-06T19:25:42.156795Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-07T05:41:58.189073Z","title":"Helpsteer2-preference: Complementing ratings with preferences, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.189073Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:f906d6b76fd710bb250d17795af2f2b1f1cace44f28dc367048471ab0af882eb","observation_id":"a39d22f1-4ff5-4198-b742-58d1984e87cb","resolution":{"observed_at":"2026-08-07T05:41:58.189073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04378","last_updated":"2025-05-30T16:42:57Z","snapshot_observed_at":"2026-07-06T20:47:51.382034Z","submitted_at":"2025-03-06T12:30:24Z","title":"HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04378","snapshot_observed_at":"2026-08-07T05:41:58.194293Z","title":"Dedicated feedback and edit models empower inference-time scaling for open-ended general-domain tasks, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.194293Z"},"links":{"cited_paper":"/paper/2503.04378","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:bc76927d9ed46fa19b6bb538266c9e20985170458ecb17d60b636f94a15525ab","observation_id":"7c84cc59-ee22-4a02-a768-fd7b8743d59b","resolution":{"observed_at":"2026-08-07T05:41:58.194293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.199448Z","title":"Jailbroken: How does llm safety training fail?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.199448Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:fc7142974c96b1ef0f9961b254283ca5464be206f322939b4b72d1e6875f7d6f","observation_id":"af33fe80-2280-4136-bebb-dc81c7ca64fa","resolution":{"observed_at":"2026-08-07T05:41:58.199448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T05:41:58.204232Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.204232Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:78ac1abe5b6589e51b0c607b955b278c55cab0b1f382e3c808eea6ee38284d06","observation_id":"31f83caf-473a-4dc5-a0cf-c022c626e965","resolution":{"observed_at":"2026-08-07T05:41:58.204232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.282421Z","title":"Efficient adversarial training in llms with continuous attacks","venue":null,"work_id":"2504fcd2-4e3c-443b-a922-b57b206087e1","year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.209633Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:e8fbdc426d865da5008a9457621b0765ebda29a38b415c0de59e82ddaf52f2a4","observation_id":"9c4d8962-1812-4646-a31b-5e688df9cacb","resolution":{"observed_at":"2026-08-07T05:41:59.286695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T05:41:58.214209Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.214209Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:34056bc0856afd715bc0d633a25fefe4d18f1652c832de001daa1bce7e28c11d","observation_id":"2c59671d-2dda-47a3-bf6b-0e3e0383f23e","resolution":{"observed_at":"2026-08-07T05:41:58.214209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00062","last_updated":"2025-04-09T19:53:54Z","snapshot_observed_at":"2026-07-06T19:43:09.889618Z","submitted_at":"2024-10-31T08:15:32Z","title":"Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00062","snapshot_observed_at":"2026-08-07T05:41:58.219409Z","title":"Le, Qijun Tan, and Yuan Liu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.219409Z"},"links":{"cited_paper":"/paper/2411.00062","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:13fcada353b366bd7226df949af880cbcb2d8357bffbf938cd0ab13baf3d2636","observation_id":"d49a9bb5-c74c-41b5-b597-caccd9fa8c15","resolution":{"observed_at":"2026-08-07T05:41:58.219409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:41:58.224328Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.224328Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:283497a70eb9ec6ecb9955b903aa8ee95cdece74fbd968f9439717849984fb7c","observation_id":"32bd10b1-7c45-47e1-9654-29027edc5667","resolution":{"observed_at":"2026-08-07T05:41:58.224328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-07T05:41:58.229345Z","title":"Absolute zero: Reinforced self-play reasoning with zero data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.229345Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:dd84ffcf81b6ee4c321ba51f71cdc1e42ab75ecaf024d1e5f7fc5098cb7e4ebe","observation_id":"d2e0e32b-b44f-4354-b195-4c694489609b","resolution":{"observed_at":"2026-08-07T05:41:58.229345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T05:41:58.234241Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.234241Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:e01a2af4fb7fedb6d1921e4cf6989a942d42c81e54603f694bd797eebdf69464","observation_id":"9c6c182b-8b7f-4fc7-a72f-4e7fedd0fdec","resolution":{"observed_at":"2026-08-07T05:41:58.234241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16335","last_updated":"2024-01-29T17:43:42Z","snapshot_observed_at":"2026-08-05T03:20:19.213455Z","submitted_at":"2024-01-29T17:43:42Z","title":"Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16335","snapshot_observed_at":"2026-08-07T05:41:58.239660Z","title":"Jordan, and Jiantao Jiao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.239660Z"},"links":{"cited_paper":"/paper/2401.16335","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:d238efc9c1d6b3b071014316974d2273e599eeb42e8ec1c51858158ed6d25895","observation_id":"7448d546-462a-47b6-bb0a-3b9a27ab379e","resolution":{"observed_at":"2026-08-07T05:41:58.239660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.264645Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"50c9c107-2065-48ad-9ab4-0b81ff3f3582","year":2018},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.244603Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:c3bbcbd5a4b8aaa36035b824de19c0a907f0b5b2a2eb3bf7ef5a39223d7b4baa","observation_id":"b1d1767a-6470-4c2a-ad17-378a7eb6ddf8","resolution":{"observed_at":"2026-08-07T05:41:59.271124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.249861Z","title":"Improving alignment and robustness with circuit breakers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.249861Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:1a24e116673c5a65d2ef20f2cf199e2a8755b1d0dc793da9fa48ada6fb9c5898","observation_id":"f110a48a-0d01-4560-85db-ea063ccf73b7","resolution":{"observed_at":"2026-08-07T05:41:58.249861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.254350Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.254350Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:1ad77a757d04b749c53f1f3a1106216b2a74ef8c1c8811c403903a88660fa766","observation_id":"0ea31367-5761-4aa2-b07d-6cd0959ea725","resolution":{"observed_at":"2026-08-07T05:41:58.254350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.259905Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.259905Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:623750035491d4bc13e8b83b8f17aa5bb9b55485df25b094c8fc6940151e7f40","observation_id":"88cd25d4-adc9-4c6d-9bba-ecef568fbe62","resolution":{"observed_at":"2026-08-07T05:41:58.259905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:58.265418Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.265418Z"},"links":{"citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:e852bb80387affa93b8808c5fed6afbf3f76af24fce1ef6c4a4f3f96ec84a7bb","observation_id":"dd5c7f15-ce84-4a1d-b87b-f2c170afa4cc","resolution":{"observed_at":"2026-08-07T05:41:58.265418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:41:58.270264Z","title":"Red Teaming Language Models with Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.270264Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:e3dda610a6ed2ba06cc75d53e4e1e992046d4ab85eef907adee7f74b3107f746","observation_id":"16a43cf8-2d79-487b-a5c6-23a335ddea32","resolution":{"observed_at":"2026-08-07T05:41:58.270264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 9 inbound Pith citation observations for arXiv:2506.07468."}