{"as_of":"2026-08-09T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f02adf31ec7f4675030ddd7a8d86388b61d2b0aa8cc0658baa4bf1665602e5dd","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:48:01.488303Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:46:20.547519Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:06.671432Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.14987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14987","snapshot_observed_at":"2026-07-04T19:40:06.671432Z","title":"Alphaalign: Incentivizing safety alignment with extremely simplified reinforcement learning.CoRR, abs/2507.14987","venue":null,"work_id":"c961b5c1-330b-4660-8cd1-0eb93ecc0099","year":2025},"citing_paper":{"arxiv_id":"2605.08936","last_updated":"2026-05-09T13:14:31Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:14:31Z","title":"Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T02:07:04.364417Z"},"links":{"cited_paper":"/paper/2507.14987","citing_paper":"/paper/2605.08936"},"observation_digest":"sha256:7eb2090e235da93f685e6092d5487661a4c228b2e81c835ddee71d178eb56f0f","observation_id":"0ad39314-b1f0-485a-8b5f-70fe4ef8b5c0","resolution":{"observed_at":"2026-05-12T02:11:16.129970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.14987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14987","snapshot_observed_at":"2026-07-04T19:40:06.671432Z","title":"Alphaalign: Incentivizing safety alignment with extremely simplified reinforcement learning.CoRR, abs/2507.14987","venue":null,"work_id":"c961b5c1-330b-4660-8cd1-0eb93ecc0099","year":2025},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-08-07T08:27:53.838717Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2507.14987","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:33eb5bc1a821e2cd3170458fcb470e943e8e79566b4b00efbf9c40cc3076da28","observation_id":"a1575c0b-db97-42d4-a424-7ccff2530cb6","resolution":{"observed_at":"2026-07-04T19:40:06.672952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14987","snapshot_observed_at":"2026-08-05T23:46:20.547519Z","title":"Alphaalign: In- centivizing safety alignment with extremely simplified rein- forcement learning.arXiv preprint arXiv:2507.14987, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-09T01:51:28.692841Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.547519Z"},"links":{"cited_paper":"/paper/2507.14987","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:2bc85d30087509c6ac050e24cf42e41c63d1b8db64f3ab21b60fdf33d889e56c","observation_id":"83c5b1b7-a17d-416c-9347-9ab31cd1660e","resolution":{"observed_at":"2026-08-05T23:46:20.547519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14987/citation-record","integrity":"/paper/2507.14987/integrity","json":"/paper/2507.14987/citation-record.json","paper":"/paper/2507.14987"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.226418Z","title":"Claude 3.5 sonnet model card addendum","venue":null,"work_id":"e2440fb4-d3fd-44ae-a237-12338a1026a6","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.301870Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:c8c6c63d3eddbb75618b1b917b29237342d386d8bc4dcd580a2119e64e1625ed","observation_id":"88ba8c8e-c977-4d46-b786-55e5cba25ab7","resolution":{"observed_at":"2026-08-06T15:48:02.229668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.216519Z","title":"Claude 3.7 sonnet system card","venue":null,"work_id":"0fa6c728-8116-471d-9e05-a9298cc8d783","year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.305361Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:1f45e643abe4f46d7730bc3530e74fde4b51089006fe0812199a6d0bb05377d4","observation_id":"d80e5d73-1e38-4a03-81a6-2d3663420e85","resolution":{"observed_at":"2026-08-06T15:48:02.219762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T15:48:01.309058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.309058Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:8e7cd87e3b036606d738d974a5002b1f7cde3ce7f8d12ffa832029a9561319d9","observation_id":"0bd55893-82c6-4e7f-b58f-c7a20b20f6f0","resolution":{"observed_at":"2026-08-06T15:48:01.309058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T15:48:01.312914Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.312914Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:54d030094b46106b229567d3be89ab9cd72ed3c0e9b6c59e1253f82b48ad09b3","observation_id":"3fe5fa3a-47f8-40a7-a1fb-c09fc21ac8d2","resolution":{"observed_at":"2026-08-06T15:48:01.312914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T15:48:01.316811Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.316811Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:2566da5dc5cd0b499b71cba2fb9c72ae873b4527d909cba47a5bb3c344889f32","observation_id":"b7dbd5c6-5592-49c6-ab0c-908c54cd6b8a","resolution":{"observed_at":"2026-08-06T15:48:01.316811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.206263Z","title":"Hadi Amini, and Yanzhao Wu","venue":null,"work_id":"86d8c762-64bb-40c9-8593-204d288968de","year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.320269Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:728b45a6ddf96fa27ca2aceeb1ebf6a4f9554bd98efe42de422a653985966ea0","observation_id":"3169a0e9-52a7-4e5f-812e-830775b113a0","resolution":{"observed_at":"2026-08-06T15:48:02.209551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-06T15:48:01.323942Z","title":"Trustworthy llms: a survey and guideline for evaluating large language models' alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.323942Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:ac14103569af1e30d7ee7126894462f123bdd310f72c3d1433e5665d578f1770","observation_id":"e6826717-384c-4b13-b4d2-b0eedd7eb3d9","resolution":{"observed_at":"2026-08-06T15:48:01.323942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11496","last_updated":"2024-11-28T02:07:46Z","snapshot_observed_at":"2026-08-09T09:14:44.003188Z","submitted_at":"2024-11-18T11:58:07Z","title":"Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11496","snapshot_observed_at":"2026-08-06T15:48:01.327760Z","title":"Safe + safe = unsafe? exploring how safe images can be exploited to jailbreak large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.327760Z"},"links":{"cited_paper":"/paper/2411.11496","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:837d6eb2a41cb7bb13ef2af19612419c6d9f418167978cdf7ff011312ac9270b","observation_id":"c4445efa-845a-47c7-91c3-2a9bb63aef44","resolution":{"observed_at":"2026-08-06T15:48:01.327760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.195385Z","title":"Kummerfeld, and Rada Mihalcea","venue":null,"work_id":"a05acf90-1236-45e4-ab13-8dd10458f03d","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.331541Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:39ced999e7bf5fbdc953df621bd414dbaada703df16f8337cb78d75ad45c51e9","observation_id":"2ce16309-30d6-4c2e-81ab-dbe6b378be84","resolution":{"observed_at":"2026-08-06T15:48:02.198848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.183611Z","title":"Towards understanding jailbreak attacks in llms: A representation space analysis","venue":null,"work_id":"19a9e592-64ff-41c8-ba80-1c8fbc8d88eb","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.335199Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:d706b4370618f487a9590caefe77049101299dc9c14b68fb0fb2f829ebdc62fb","observation_id":"9e2ec079-d332-444a-9c5b-7f9aabb0ce09","resolution":{"observed_at":"2026-08-06T15:48:02.187307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.172473Z","title":"Uncovering safety risks of large language models through concept activation vector","venue":null,"work_id":"faa42a44-4e85-45b1-b724-e50caf593700","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.340006Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:268556fb44ff96f58c3d2ce0d088bfc9135ae8cd804ee8945682f061b8b23b8c","observation_id":"ae7756c7-859a-47ee-9ec7-d1d2f800487f","resolution":{"observed_at":"2026-08-06T15:48:02.176509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.160995Z","title":"On prompt-driven safeguarding for large language models","venue":null,"work_id":"cf15ac66-b4b2-4684-b706-fac6642dd1b3","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.344062Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:cfbd5d96a81e0b3b27666ef6e0ed9550d37baaa2d439c347527b2b1757a423d5","observation_id":"b86170f1-ddd6-431b-80c1-1690a8b0d795","resolution":{"observed_at":"2026-08-06T15:48:02.164319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.151078Z","title":"Nguyen, Jun Sun, and Tat - Seng Chua","venue":null,"work_id":"06b3df0a-9f99-43a1-8593-66ed3c39539f","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.347270Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:3afe9dd79890c3aa15752dd112829870a32ef43f07b58fe0840c70860a142690","observation_id":"f572c8e5-e434-4ba6-bbb2-951b37b78fb2","resolution":{"observed_at":"2026-08-06T15:48:02.154293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.140226Z","title":"Jailbroken: How does LLM safety training fail? In NeurIPS, 2023","venue":null,"work_id":"fde33d1b-7620-422a-877a-7befc85ce297","year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.350463Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:955ad8158947c91047aabb551dffb631ef6cf5bd0b7cefb4a1f5210d281814d5","observation_id":"337aa62b-04b5-42e8-a50f-5fb9a4304c0a","resolution":{"observed_at":"2026-08-06T15:48:02.143935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04040","last_updated":"2025-05-30T09:43:42Z","snapshot_observed_at":"2026-08-08T23:43:13.905441Z","submitted_at":"2025-02-06T13:01:44Z","title":"Safety Reasoning with Guidelines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04040","snapshot_observed_at":"2026-08-06T15:48:01.356987Z","title":"Leveraging reasoning with guidelines to elicit and utilize knowledge for enhancing safety alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.356987Z"},"links":{"cited_paper":"/paper/2502.04040","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:ac6d923e6549a5e3ee12a490fbcd6e10c45241b950e4777567ad39e543fa9947","observation_id":"0064e74f-d67b-4e40-b717-2c99ddc7614c","resolution":{"observed_at":"2026-08-06T15:48:01.356987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.128782Z","title":"Rule based rewards for language model safety","venue":null,"work_id":"103fc733-3752-4070-966c-3894a11ac2f9","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.360307Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:51be151a4bd70760cb6174d4e955dac4497d3b9d9dbdc93e8c741b724d4a5678","observation_id":"03d9e388-4c7d-45ee-9429-c8443e144e39","resolution":{"observed_at":"2026-08-06T15:48:02.132567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.363452Z","title":"Safety is not only about refusal: Reasoning-enhanced fine-tuning for interpretable LLM safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.363452Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:ae5f90b5f9c900f0c6b446f33e1a1fc1fc34658e768555d8f01299559fb51fe2","observation_id":"1865f620-a909-40b7-a460-e45446f6d8f0","resolution":{"observed_at":"2026-08-06T15:48:01.363452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.117852Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":"a6fc30a3-0aea-4f45-9b75-220789d9c29c","year":2022},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.366857Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:9f79f7c09028f7f201667bd44eca745817d9287d1f8ffc86842fbb5bd8f81b7e","observation_id":"a6aa999a-65fe-4a16-a1af-f85c3a9b6d6d","resolution":{"observed_at":"2026-08-06T15:48:02.121098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.369990Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.369990Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:b96c8f0235910cacff6d916a693b0e3d6ba82f1242840d3f11d8e25d4f24aca3","observation_id":"808083e7-b3a3-4e0c-ae05-a92ca6e7c8ac","resolution":{"observed_at":"2026-08-06T15:48:01.369990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.373404Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.373404Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:60f534bdd1267086633267d58f9105f92803256728a09cef644f25e7372fd0d8","observation_id":"259e10b5-eb2d-4174-be50-c6a1a9969e59","resolution":{"observed_at":"2026-08-06T15:48:01.373404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.092427Z","title":"Safe lora: The silver lining of reducing safety risks when finetuning large language models","venue":null,"work_id":"d4d50dd9-2477-4a71-ad2b-578c037f22ec","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.376537Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:6e08aedf162acc42da4d4d775b596a75326afd9b31dcd17472ce02cb13ed5b5d","observation_id":"b502d8ad-ff9b-4891-9fb4-fa4f7923d7b2","resolution":{"observed_at":"2026-08-06T15:48:02.095789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.082636Z","title":"Zico Kolter, Matt Fredrikson, and Dan Hendrycks","venue":null,"work_id":"d7e0b8cc-6efb-41dc-8160-ffd3f0e703d1","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.379757Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:15b3e71d0128a51f84d0bc2114a06b2036c8cffac5ca8ec4b2c47d36c677ae29","observation_id":"c8dd559e-859e-45f9-8052-95d8bd935554","resolution":{"observed_at":"2026-08-06T15:48:02.085637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-08T03:05:18.803803Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-06T15:48:01.382809Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.382809Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:2d659cfa21bef934130f269189d5899eda9cef42611f0dc74342e31f99efb3d2","observation_id":"c4b5728f-b8ff-4436-83de-53d40cfe133f","resolution":{"observed_at":"2026-08-06T15:48:01.382809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T15:48:01.386002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.386002Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:f41d99b24bd5c54f02d988d34a11c6e064bea0fca43fbb615d1a1a70c7aa220d","observation_id":"449e52f3-1076-4415-b5b0-64a3b80315c0","resolution":{"observed_at":"2026-08-06T15:48:01.386002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.388982Z","title":"Enhancing model defense against jailbreaks with proactive safety reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.388982Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:1ab95df92a8d574fc2d6401a765a815bbe656d365146c611780a4fca06ad87b9","observation_id":"1600e39f-f572-4f6c-a4ea-866b9f0be95d","resolution":{"observed_at":"2026-08-06T15:48:01.388982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.392182Z","title":"Reasoning-to-defend: Safety-aware reasoning can defend large language models from jailbreaking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.392182Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:78ea0f4955749f550d403d847f310f5728b6efc46c112870668bc051bf6f2cd8","observation_id":"c04d912f-6ad0-46de-9970-157ed05c112d","resolution":{"observed_at":"2026-08-06T15:48:01.392182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.073314Z","title":"Bikel, Jason E","venue":null,"work_id":"ba132451-cdf9-4a0b-8361-e222cdf1e04f","year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.395614Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:19765d8e1db5c3b0794f70b24bcbfc7f35ce6b8529de5d996896bc04addd6729","observation_id":"6c62134f-a5b8-4b75-8a62-20223ca065e8","resolution":{"observed_at":"2026-08-06T15:48:02.076369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11969","last_updated":"2025-04-17T18:36:08Z","snapshot_observed_at":"2026-07-06T18:47:21.527912Z","submitted_at":"2024-07-16T17:59:55Z","title":"Does Refusal Training in LLMs Generalize to the Past Tense?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11969","snapshot_observed_at":"2026-08-06T15:48:01.398901Z","title":"Does refusal training in llms generalize to the past tense? CoRR, abs/2407.11969, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.398901Z"},"links":{"cited_paper":"/paper/2407.11969","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:0fe98b73c0e9101888fa2c33f2c01f8a7fd18d37620b658c03b512d6785c5da5","observation_id":"d50ed610-393a-461e-9e5c-49de9b04a66c","resolution":{"observed_at":"2026-08-06T15:48:01.398901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.063739Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In ICLR , 2024 b","venue":null,"work_id":"83bf04b5-b653-4773-9884-17a939361b87","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.402803Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:45cdadaf905eba648f3f80cb9ce828ad5849839d1bebae46034c9e6132b1d03f","observation_id":"2b78b9f0-7a0e-4039-8e93-d406d8f2ae0c","resolution":{"observed_at":"2026-08-06T15:48:02.066996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T15:48:01.405908Z","title":"Bowman, Zac Hatfield - Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.405908Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:1b822131a8aaf91fbe0afa44bb0db706fb8ce31cc87e38ef7974de8aa935989b","observation_id":"f1929073-70ea-4d28-aba7-49977dfbb656","resolution":{"observed_at":"2026-08-06T15:48:01.405908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:48:01.409511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.409511Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:f0909606dff6da7069212ba3aff632601fe4bbfea28b643a478bdde988a07afb","observation_id":"899225ce-cc30-48db-baea-f4a0d0aee895","resolution":{"observed_at":"2026-08-06T15:48:01.409511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T15:48:01.413147Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.413147Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:ee0b315857383cf7ab7cc19e8bcf472e237e486a7c1c60ca50e3226ac2aae8ec","observation_id":"360512d6-0b7c-4d22-9ad5-1df3e4542611","resolution":{"observed_at":"2026-08-06T15:48:01.413147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T15:48:01.416557Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.416557Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:04819f25d6ff3fee9d892b27cbe35571d7d7898f5d07fe0405105c5204cd9b84","observation_id":"81b675cb-451b-41e5-8199-e56ff022df83","resolution":{"observed_at":"2026-08-06T15:48:01.416557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-08T21:52:29.510852Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-06T15:48:01.420708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.420708Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:2b810e95d871c60e5f7f864ef87c945ff1026dbd924fa21d6cbe48faf711d1c6","observation_id":"d2109089-99c2-41ee-9788-e561901be489","resolution":{"observed_at":"2026-08-06T15:48:01.420708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:48:01.424241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.424241Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:c6fa15e0cd306b5f96876e71bec20feadbc9646f871533481ad3dca643bf549f","observation_id":"9af60e70-f02b-4ebb-8450-da15badc50b0","resolution":{"observed_at":"2026-08-06T15:48:01.424241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T15:48:01.428077Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.428077Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:644b5c362301ca662a509aebfde2062988a9d748d344da8f62fac7678f309c22","observation_id":"5a80a100-a6ef-4799-9694-013717548600","resolution":{"observed_at":"2026-08-06T15:48:01.428077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T15:48:01.431316Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.431316Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:a60d49ffb1895441a5d6e8df23d75736772d5c81f0bdeb0c8527628fe9bb7b4b","observation_id":"a5ed7fa2-05ae-42b8-83bd-5e6dc2241560","resolution":{"observed_at":"2026-08-06T15:48:01.431316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.053855Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":"86273950-a86d-4f90-a786-1f58940b5bd9","year":2016},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.434748Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:c3f20152b68a6be334820170fcc77e36940c5aba7bd02d31b07bf5281591627e","observation_id":"b6d57317-baef-4e62-ac3f-bf8c51e592c0","resolution":{"observed_at":"2026-08-06T15:48:02.056797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.437956Z","title":"A strongreject for empty jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.437956Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:4b8c06423856b11a2a9deba555bc2d421725bdf00f4790afc7b79ba4112fc041","observation_id":"0f6e7206-c031-46f3-8e11-5fbed43cc04d","resolution":{"observed_at":"2026-08-06T15:48:01.437956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:48:01.441397Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.441397Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:43e2edb4cb09d78d1c9d5665958a18c44649acb7d871ae397750f875dd2f49ab","observation_id":"05a11772-9b8d-4347-87ad-2ea278f2011e","resolution":{"observed_at":"2026-08-06T15:48:01.441397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.036667Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms","venue":null,"work_id":"bba32eda-a2e7-43ae-a2c8-620fbb11d786","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.444984Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:4c48dd4029b1c7e21306491091061a179507d87de5b88275a36f110fbd205cd7","observation_id":"cda7c6b2-92cc-4789-890d-0239ae4548ac","resolution":{"observed_at":"2026-08-06T15:48:02.040032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.026460Z","title":null,"venue":null,"work_id":"5916bf6a-8138-4f5f-b27c-ae5b2afcb2d5","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.448493Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:9ad7bc2657008da8beaa0810d0ba026f0d1b9b861b985bb37343567446465571","observation_id":"04cb8820-72d2-4536-b12f-2c765052765e","resolution":{"observed_at":"2026-08-06T15:48:02.029712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-06T15:48:01.451746Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.451746Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:21bba5dea115cf4e2a0cf2cb5feef279445be42f02b32c7d63a544f4a4a02c8a","observation_id":"53376565-e138-4c82-bfd6-a4b69299a99a","resolution":{"observed_at":"2026-08-06T15:48:01.451746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-06T15:48:01.454863Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.454863Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:f50be38f11b2e0a947f81a095e39a96af82638fc6638cb3ca0f65f6e2fbcba4a","observation_id":"2de32363-6a72-45f3-a94f-7fa96500ef52","resolution":{"observed_at":"2026-08-06T15:48:01.454863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.016771Z","title":"Smith, Yejin Choi, and Hanna Hajishirzi","venue":null,"work_id":"bbd8c712-2db2-4f8a-b8fc-075e4c3097b8","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.458530Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:7982714281c8d07c76aa1eb48155e552681a1de40d1a4ffd4293a827f48f42b8","observation_id":"ddb9a189-4774-4efc-af9c-4a844b2ae6c8","resolution":{"observed_at":"2026-08-06T15:48:02.019937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:02.005936Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"158633db-dedd-4e8a-bfdf-40b94d74141a","year":2021},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.461444Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:1aa073fd16ae4c21dabdb019a1839a69360ae3674e15ce8a7d94b8aac019325f","observation_id":"6a0dec33-4c25-4381-903b-8a2bfec30c1e","resolution":{"observed_at":"2026-08-06T15:48:02.009395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-06T15:48:01.464564Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.464564Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:b7f086bde595fce8f1eea86c133dfd5643fdc3f3e5727e8892cf06e7b3000820","observation_id":"9d460353-3ff9-41c4-b0c3-679149ea8655","resolution":{"observed_at":"2026-08-06T15:48:01.464564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T15:48:01.467912Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.467912Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:f751762887facbcceac3e2101731d5b96623206cd61178ee35ab6ff74381bc6a","observation_id":"95f9e80f-c966-49b4-9e9e-1dc38a4d5fe4","resolution":{"observed_at":"2026-08-06T15:48:01.467912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:48:01.471447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.471447Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:5a5da439747420bdbb9d2e855d6997279a97610f2aa9e11308131996849555f9","observation_id":"ffa41b95-17d9-4168-811e-97642a8be57d","resolution":{"observed_at":"2026-08-06T15:48:01.471447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T15:48:01.475049Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.475049Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:60d800dd5acb81108f84be62e6c13431866ec133c241c3e419bedaa990a9f958","observation_id":"a9b04422-6b54-44f1-9b15-d7d196de2a5f","resolution":{"observed_at":"2026-08-06T15:48:01.475049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.478311Z","title":"Free dolly: Introducing the world's first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.478311Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:cb97f18c53fb42bd4ddfc5d681902872e911d10461a6693c23adfb9b222b4a96","observation_id":"572296ea-4dd0-4882-9ef0-3338dad7fd00","resolution":{"observed_at":"2026-08-06T15:48:01.478311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.986133Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":"ee0e12dc-06be-459c-b039-e14e9de7b6c9","year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.481650Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:57ac8a90497f453f07ba554da575ab488dbd18b7876fec9c193c34685f7293cf","observation_id":"7feb1d53-edbb-42e0-9f61-9bff21590fc5","resolution":{"observed_at":"2026-08-06T15:48:01.991310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T15:48:01.484886Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.484886Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:5b86a224301c843ac22c0cbf08e6cbf62c44fdbf08e281454abdb84b8986e47f","observation_id":"22bfb320-4556-4c0c-8a4a-51cafd65d2cc","resolution":{"observed_at":"2026-08-06T15:48:01.484886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:01.488303Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.488303Z"},"links":{"citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:5e8dcbf0fd1b86fe5b55c43981c297c3352a617e95af7937f27bd5afa60253d7","observation_id":"5c2cfbf5-5502-4743-bb2f-114e7d7fc1a7","resolution":{"observed_at":"2026-08-06T15:48:01.488303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2507.14987."}