{"as_of":"2026-08-08T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c365c922334b737d6a4be1a6e2e9013f75f5ccf1a275b8d23db19facd68ac41","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:20.444420Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04302/citation-record","integrity":"/paper/2506.04302/integrity","json":"/paper/2506.04302/citation-record.json","paper":"/paper/2506.04302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.765656Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"34451ac7-2f2d-4835-9f99-d2da1877fb5b","year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.959731Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:093b5091025ca0115567afda8849c8cac846cac949dcf24b4de1a9d399fdb139","observation_id":"f175e702-865c-41fb-9b1a-e41681f97f73","resolution":{"observed_at":"2026-08-07T10:55:21.772227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-07T10:55:19.968574Z","title":"Unsolved problems in ml safety","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.968574Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:3e415fd05ac9749a458c962dee797fdbff43355a12cbfc861e08b0c71cdf376e","observation_id":"dc690450-026d-45d9-979c-2b506f6cd357","resolution":{"observed_at":"2026-08-07T10:55:19.968574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T10:55:19.978526Z","title":"Red teaming language models to reduce harms: Methods, scaling behav- iors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.978526Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:84575eeea82be21130626216b276601b601041f3e5648f9e8dbecbb8a8a2a302","observation_id":"17cc6a00-b7c4-4ae6-8e15-cffb15d9a430","resolution":{"observed_at":"2026-08-07T10:55:19.978526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-08T01:18:53.200448Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-07T10:55:19.989451Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.989451Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:155e329e0ab81b1a1fd45893ecc3537f28a5fe54933678c620e75f84c5501e11","observation_id":"7a20bf65-7fe3-483d-939c-4c47a640d3ac","resolution":{"observed_at":"2026-08-07T10:55:19.989451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-07T10:55:20.000342Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.000342Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:54a0c257a797dbab79bc20190f5756de9416b087cf59e2e11074650b86141949","observation_id":"381be7f1-ef81-4ae9-b907-d175e55a1aa0","resolution":{"observed_at":"2026-08-07T10:55:20.000342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17444","last_updated":"2023-05-27T11:00:15Z","snapshot_observed_at":"2026-08-04T18:01:36.540422Z","submitted_at":"2023-05-27T11:00:15Z","title":"Query-Efficient Black-Box Red Teaming via Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17444","snapshot_observed_at":"2026-08-07T10:55:20.011756Z","title":"Query-efficient black-box red teaming via bayesian optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.011756Z"},"links":{"cited_paper":"/paper/2305.17444","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:a6f728821bfae3974af4303b9865d610d505486da745974de11fcdfa68011a0d","observation_id":"0c503a99-6875-4ae6-9011-00c5c4b72415","resolution":{"observed_at":"2026-08-07T10:55:20.011756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-07T10:55:20.027907Z","title":"Large language models as optimizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.027907Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:d0d54e10b1436920484d209e8c0bc780662be43bb216c96dc370f9e23de29c27","observation_id":"853fdc58-f2a8-47a3-aa54-12b83aee6b31","resolution":{"observed_at":"2026-08-07T10:55:20.027907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-07T10:55:20.037233Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.037233Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:358243013df630e26446f4eb3181014eb7c2a44ad835591873fdb6d4bc60f07f","observation_id":"cac5389b-1754-4149-881a-773667e75f80","resolution":{"observed_at":"2026-08-07T10:55:20.037233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.746681Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":"3b9b004d-458c-4ff6-88c4-09c04928583a","year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.043431Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:5089d9f70c8a36620a6f7409fbe91b199beef93f39513b4d351f9e09cc6eda1f","observation_id":"382dc7af-da47-42fe-b859-be941488cdc2","resolution":{"observed_at":"2026-08-07T10:55:21.752229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12505","last_updated":"2023-10-19T06:15:05Z","snapshot_observed_at":"2026-07-06T16:35:27.763870Z","submitted_at":"2023-10-19T06:15:05Z","title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12505","snapshot_observed_at":"2026-08-07T10:55:20.050296Z","title":"Attack prompt generation for red teaming and defending large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.050296Z"},"links":{"cited_paper":"/paper/2310.12505","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:c6dd340d3456d8e269ec4368a3ad277b445d752b9950beaa3d9c29bf198ec01b","observation_id":"b06c2a86-7fd2-4537-92e4-511cf268330d","resolution":{"observed_at":"2026-08-07T10:55:20.050296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T10:55:20.057855Z","title":"Explore, establish, exploit: Red teaming language models from scratch","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.057855Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:d44f6fc467a3d9bdeedb9617ecab1662404c7690c250a35e6e44198980bd23a0","observation_id":"ae34b8d3-fbac-43ec-a207-7dba2ef5b36d","resolution":{"observed_at":"2026-08-07T10:55:20.057855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19464","last_updated":"2024-02-29T18:55:03Z","snapshot_observed_at":"2026-08-04T22:49:54.802240Z","submitted_at":"2024-02-29T18:55:03Z","title":"Curiosity-driven Red-teaming for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19464","snapshot_observed_at":"2026-08-07T10:55:20.071156Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.071156Z"},"links":{"cited_paper":"/paper/2402.19464","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:1d9426548aeb975885c5f00bffd8c1c85ffd67c35145724e0904a40b10311c72","observation_id":"3e93d054-5718-4965-a335-c1904c8f7421","resolution":{"observed_at":"2026-08-07T10:55:20.071156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.726699Z","title":"DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing Constraints","venue":null,"work_id":"f65c08f3-5522-4e9a-84ff-ffd7ffe6a307","year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.078058Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:22934b79b73fe3bbbbc40b8492e4a4c6bce5f9c0e3fcb16da6c8cea78106cb27","observation_id":"87957fe8-5de1-449b-9104-f13c3a4e5268","resolution":{"observed_at":"2026-08-07T10:55:21.732369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02997","last_updated":"2025-01-06T13:14:34Z","snapshot_observed_at":"2026-08-05T12:00:37.318093Z","submitted_at":"2025-01-06T13:14:34Z","title":"CALM: Curiosity-Driven Auditing for Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.02997","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02997","snapshot_observed_at":"2026-08-07T10:55:20.939944Z","title":"CALM: Curiosity-Driven Auditing for Large Language Models","venue":"cs.AI","work_id":"b37f535e-c6d4-4c28-a207-9cfe398ffc8f","year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.085750Z"},"links":{"cited_paper":"/paper/2501.02997","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:34f778bf317d79a4a9675ed18c02f6bca99871681b84afd4c4ffa90a2a28aff0","observation_id":"38a38d83-3fff-443d-a6f5-8bef94cf5d1d","resolution":{"observed_at":"2026-08-07T10:55:20.946358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.711399Z","title":"CIM: Constrained Intrinsic Motivation for Reinforcement Learning","venue":null,"work_id":"45028b3d-224d-46d4-b23a-9efa2bc09a9d","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.096049Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:495875a8d4eed78c515a37c587ad6b19cc58396c8b16b6dd7b182dfd5352a81d","observation_id":"9b2881ed-b30b-4c61-9fb6-045bdf8030f9","resolution":{"observed_at":"2026-08-07T10:55:21.716179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:55:20.103060Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.103060Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:0d976e0efb58cab71618b990fd990dc947b964e8655b02c4e4e528d300ae01d9","observation_id":"a9f03fec-4556-4d63-a544-00dd68645c7e","resolution":{"observed_at":"2026-08-07T10:55:20.103060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T10:55:20.110906Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.110906Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:aa13ff5e068617035c2ab403e657c0a0208acd059fa0d3a085e98f129bdde239","observation_id":"d7c316e8-2e99-4ee5-8f7d-4ed2de119e3a","resolution":{"observed_at":"2026-08-07T10:55:20.110906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.694474Z","title":"Tree of attacks: Jailbreaking black-box llms automatically","venue":null,"work_id":"b696cf9b-debf-4079-a093-eab3944f8749","year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.118783Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:93da08ac4729049f7459a48b675e0f865b4bd7f14d264d1467186c5c56d7b161","observation_id":"33da88f3-d4b9-4424-ba63-b3cec21e6766","resolution":{"observed_at":"2026-08-07T10:55:21.699718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.678132Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":"19782825-9441-43a6-9067-bb88dc95101e","year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.124594Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:5db0ad6c6dc55abd7003611ed956354e8a50816f7866ae29d7d2408fc6e86410","observation_id":"9a313817-9950-4f83-a6e9-e015f0e9b66c","resolution":{"observed_at":"2026-08-07T10:55:21.683610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-07T10:55:20.132349Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.132349Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:29729ea1a240509c52f893c4a4e6b1170f380be08fbf3719a0468b844a08399e","observation_id":"ad3fbefa-428f-42c0-8b06-d0a1cd315538","resolution":{"observed_at":"2026-08-07T10:55:20.132349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.662052Z","title":"https://github.com/ huggingface/trl","venue":null,"work_id":"0b280d8a-aaed-434e-9a56-63f5a813c221","year":2020},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.138450Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:340ab722904c54676df6e72bdf556d07e928bb83eedec0d8de1fa77134d90fa6","observation_id":"8ea00912-2743-44fc-9d6c-47e46ac6d4a0","resolution":{"observed_at":"2026-08-07T10:55:21.667522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.644606Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"d05fb79f-79a3-4364-9039-86d44c246e32","year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.147018Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:148ca57cd9e3afef97ad1f92db87f86ef4d87825463f0dc0be79dca2b821aef2","observation_id":"381dc6ef-ac5c-49ae-b65b-9b98b331c786","resolution":{"observed_at":"2026-08-07T10:55:21.650520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T10:55:20.161901Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Frame- work","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.161901Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:c79219f042efa5ff67afdb0d81bd54c4340b75f195b439aea5e98b9add440da0","observation_id":"908c75a0-f94a-4865-a9f4-8d9bbe7e8e9f","resolution":{"observed_at":"2026-08-07T10:55:20.161901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:55:20.167213Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.167213Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:85c951cb558627e8f6a08e0e3b8dcf0c493f1758c6ed9d108ac5f3606260c133","observation_id":"08285b22-1570-4643-add2-818f40fc8436","resolution":{"observed_at":"2026-08-07T10:55:20.167213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01241","last_updated":"2023-03-01T01:31:17Z","snapshot_observed_at":"2026-07-06T13:59:15.998573Z","submitted_at":"2022-10-03T21:38:29Z","title":"Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01241","snapshot_observed_at":"2026-08-07T10:55:20.175303Z","title":"Is reinforcement learning (not) for natural language processing: Benchmarks, baselines, and building blocks for natural language policy optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.175303Z"},"links":{"cited_paper":"/paper/2210.01241","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:33322a20b897afca54dcc4a5583da948748d9304d10b8fcbda626881e5c0a1db","observation_id":"4ed6cbbe-99a6-41cd-ae6a-9d427b1592b3","resolution":{"observed_at":"2026-08-07T10:55:20.175303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:55:20.188583Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.188583Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:e029b965cd8ab3d8f7a7fff55f6fb441154066a8840edc02a2526af9ad44d71c","observation_id":"87e49c1d-7f06-4080-852f-d4786f7fc0d8","resolution":{"observed_at":"2026-08-07T10:55:20.188583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:55:20.197684Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.197684Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:726d3421ab9bbf92d504bfecc1a2819a088bcf3368dd9c126fd24ac5acc1fe39","observation_id":"8aeef9cb-e71d-4f57-998c-6696040a3799","resolution":{"observed_at":"2026-08-07T10:55:20.197684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T10:55:20.205546Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.205546Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:fc3ae95f6996843048f7d5bd11e62bb2477f25bf0ea90527db3f6b4185bc653f","observation_id":"b4b230da-84bc-4768-b4c3-268d49f2c8c0","resolution":{"observed_at":"2026-08-07T10:55:20.205546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-07-06T12:03:06.452840Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-07T10:55:20.212381Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.212381Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:d63734ea7f39566506d86e53c1159a3279b3619385db37989bbc471477b0dd4a","observation_id":"0ab1fa87-310f-4571-ad83-a3e2d187c08c","resolution":{"observed_at":"2026-08-07T10:55:20.212381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-07T10:55:20.217369Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.217369Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:be7476a851880f438f9fae7db2e3fb5ec7b1fcf2fccb68e6e9356269a7d3b77d","observation_id":"40351ced-22cb-4d3f-a5c6-0c5bc8cea678","resolution":{"observed_at":"2026-08-07T10:55:20.217369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-02T13:41:53.507553Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-07T10:55:20.225697Z","title":"Large-scale study of curiosity-driven learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.225697Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:8b76f3e54cd13dd2a8886ec4da55d79576cdbdcd81921702d07065a24e264ddf","observation_id":"a180c0b8-31ba-47a6-8997-c72253260825","resolution":{"observed_at":"2026-08-07T10:55:20.225697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.626821Z","title":"Made: Exploration via maximizing deviation from explored regions","venue":null,"work_id":"b8a89a27-ce55-4c3f-9d21-b0e77cfac798","year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.231970Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:c2f66713fce1072c7d42a2385925f9d851ab67f366e861ca3aa2391c14e4f170","observation_id":"2a95946f-6344-4dda-9356-a73851590d2b","resolution":{"observed_at":"2026-08-07T10:55:21.632220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.609095Z","title":"Aps: Active pretraining with successor features","venue":null,"work_id":"c25ce070-9f38-4c58-975f-9240ac160164","year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.242868Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:92c894e53e747d3a446329d23caafa4e90164ec877fcdeea775412d6f18f316f","observation_id":"87a2b6a5-e034-47bd-b063-0a4a9d478ccf","resolution":{"observed_at":"2026-08-07T10:55:21.615141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.591822Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"edab8638-0632-411f-ad43-5d0c4eb748d4","year":2019},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.248052Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:38065ccec0dfc7f1c1ccd3136dff1bfa57863cdb9b2ad2a9eb5e89f39852c979","observation_id":"9902af5a-2f2c-4bf3-9db7-8616ceb4b872","resolution":{"observed_at":"2026-08-07T10:55:21.597103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.574795Z","title":"Task-agnostic exploration via policy gradient of a non-parametric state entropy estimate","venue":null,"work_id":"66b451a5-04a1-4ab9-9646-435ee73e93c3","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.254621Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:35ea5fe594ba0635ae9e5f24432f56a1ede7f5eec6f600f79a1732e2391aa77f","observation_id":"46edf65b-7e79-4371-8a30-383151690748","resolution":{"observed_at":"2026-08-07T10:55:21.579769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.558442Z","title":"Behavior from the void: Unsupervised active pre-training","venue":null,"work_id":"f13e7759-c331-4894-8188-ee5b28260dd3","year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.260652Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:dc404b706cea2d4aa8761a5d5427afe6a30424636079867a769ab0bc50b58e62","observation_id":"63dc068b-a992-475e-836b-fa81c7bae7ed","resolution":{"observed_at":"2026-08-07T10:55:21.563908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08887","last_updated":"2024-03-10T04:30:17Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T06:43:11Z","title":"METRA: Scalable Unsupervised RL with Metric-Aware Abstraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08887","snapshot_observed_at":"2026-08-07T10:55:20.265825Z","title":"Metra: Scalable unsupervised rl with metric- aware abstraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.265825Z"},"links":{"cited_paper":"/paper/2310.08887","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:86c701dddc071732210bee0ed69462eeb03b36b3706ba3185824673aab29627d","observation_id":"9623f91d-a38e-4822-b268-deb1e410a141","resolution":{"observed_at":"2026-08-07T10:55:20.265825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07507","last_updated":"2016-11-22T20:44:39Z","snapshot_observed_at":"2026-08-02T15:05:52.307944Z","submitted_at":"2016-11-22T20:44:39Z","title":"Variational Intrinsic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07507","snapshot_observed_at":"2026-08-07T10:55:20.272855Z","title":"Variational intrinsic control","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.272855Z"},"links":{"cited_paper":"/paper/1611.07507","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:2f0f854c7dbda0901a03ee44b00b8e31cda6436f6cc450f045eba8885adf75da","observation_id":"5debbec7-ef51-442b-821b-4bede4fed053","resolution":{"observed_at":"2026-08-07T10:55:20.272855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01657","last_updated":"2020-02-14T23:20:43Z","snapshot_observed_at":"2026-08-07T06:01:49.776810Z","submitted_at":"2019-07-02T21:32:19Z","title":"Dynamics-Aware Unsupervised Discovery of Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01657","snapshot_observed_at":"2026-08-07T10:55:20.279140Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.279140Z"},"links":{"cited_paper":"/paper/1907.01657","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:67d9dfa17391b1ae76484a33263a80a0ed30c965b492f0c5980506276ebc22cf","observation_id":"e03d3241-ec77-42e9-b744-9191bd314146","resolution":{"observed_at":"2026-08-07T10:55:20.279140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00161","last_updated":"2022-03-30T01:09:18Z","snapshot_observed_at":"2026-08-05T17:23:09.985316Z","submitted_at":"2022-02-01T00:36:29Z","title":"CIC: Contrastive Intrinsic Control for Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00161","snapshot_observed_at":"2026-08-07T10:55:20.286572Z","title":"Cic: Contrastive intrinsic control for unsupervised skill discovery","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.286572Z"},"links":{"cited_paper":"/paper/2202.00161","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:6014998852f3eb277b6c18ab5ecbdb4c2caf54fd60a6dc29aadd2a6e8aef3b98","observation_id":"3b9a831c-c371-4a1a-8e9f-7b704e083dd4","resolution":{"observed_at":"2026-08-07T10:55:20.286572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.540207Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":"238c5feb-381f-494c-b62d-c2a1a2e5b993","year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.294060Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:a20676dbef4941020873008dde583b907ffb886e7c9d34f9ddb1a8d7b133e28f","observation_id":"7edfc9e9-e9a3-4498-861d-cc2b94dbd0e2","resolution":{"observed_at":"2026-08-07T10:55:21.546382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.525020Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":"51c48b6c-de8e-4ff0-a160-f4d4741a59ab","year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.300397Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:314f71c061adb1bf05e9ecac2389930bee1c4976a45705bdb20ba3cbf21d191c","observation_id":"400927c6-059a-448b-99bc-51f51c43c6dc","resolution":{"observed_at":"2026-08-07T10:55:21.529985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.507821Z","title":"Behavior contrastive learning for unsupervised skill discovery","venue":null,"work_id":"baf08150-b896-4536-878a-de37b66b0435","year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.307494Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:24a86253bbdee126d377e7fd0d7eb477d4dc2b91688450e604bdd7a33b5138ae","observation_id":"663a31b7-a700-41ba-ad81-9d45e84ce291","resolution":{"observed_at":"2026-08-07T10:55:21.514043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09247","last_updated":"2024-07-12T13:20:52Z","snapshot_observed_at":"2026-07-06T18:45:22.812592Z","submitted_at":"2024-07-12T13:20:52Z","title":"Constrained Intrinsic Motivation for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2407.09247","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.09247","snapshot_observed_at":"2026-08-07T10:55:20.526743Z","title":"Constrained Intrinsic Motivation for Reinforcement Learning","venue":"cs.AI","work_id":"06920247-f631-4da6-9142-92f063e074b3","year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.314427Z"},"links":{"cited_paper":"/paper/2407.09247","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:a390f44ec0e104bf737636ea1d3bff1c5204d8647c4b55b243ce885ba880a109","observation_id":"58364df4-b6e3-41b3-b97f-1b27c1a821fb","resolution":{"observed_at":"2026-08-07T10:55:20.543202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.488446Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"2c99f3bf-32b9-416a-9ee8-37043ecfd4f1","year":2018},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.322001Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:3dfdfc476b12d3214451cee567d448afbacff68b113f810eecf60903c7770a56","observation_id":"6827f958-515b-4993-9e21-ce34312fc62d","resolution":{"observed_at":"2026-08-07T10:55:21.495004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.462290Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"f4cf0e8a-5720-496b-965f-476bf99939c7","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.328339Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:521cd4514e1af0daac776e8ed41d3b234178305e573fe5b581c3e111d30c05a8","observation_id":"54a87242-300d-4a7e-ac4e-925cfcd01723","resolution":{"observed_at":"2026-08-07T10:55:21.471942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.438541Z","title":"Limitations","venue":null,"work_id":"549f879e-1736-4975-8c3f-f92c3e7ffeef","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.333557Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:1e4d2ea733f9f2d49d2219cf163bee7f38dafb29715246e6da589c14999de3e7","observation_id":"3b7f25ba-2680-4287-a94a-9c13dfc3475a","resolution":{"observed_at":"2026-08-07T10:55:21.445445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.416383Z","title":"Thus, we do not provide original theoretical results of the each baseline method","venue":null,"work_id":"2e958b7f-8972-4b49-a3e1-69c85755965d","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.338073Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:e26b4d581596888fc7589b90cd273efed8772ef094191b1d8bbe7df7577127e0","observation_id":"43689bd1-c7ff-4d64-983c-b29be3ea708a","resolution":{"observed_at":"2026-08-07T10:55:21.421981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.393930Z","title":"Our experiment results can be easily reproduced with a simple environment setup, the default config files, and the prepared shell scripts","venue":null,"work_id":"a10532e0-f6fa-419e-970d-4ad91bf6b791","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.344055Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:2908123ff151d30b6f7d61e145383e1628e40c1451b96196b30f0d29a4c18db2","observation_id":"2e769d34-be7d-4293-9717-f63132a532ba","resolution":{"observed_at":"2026-08-07T10:55:21.401126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.368653Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"3f3f18c6-032e-41ec-99ab-b18d1e45c9ad","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.350750Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:918966bb622ead485365459ec5ea672e3c9cd7395c51d311edd03dcdf271c2b8","observation_id":"729bd66c-a64a-44e7-8592-905e34f9ad0e","resolution":{"observed_at":"2026-08-07T10:55:21.375072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.345899Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5856b46a-3068-4262-8d14-c35cba86db53","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.359237Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:eca7bac6cff2d6a0d525e4e568f27d350b6e372aa4b6429a4af6468b67da8763","observation_id":"541639fb-fc2c-4f21-b843-2c2018df7c94","resolution":{"observed_at":"2026-08-07T10:55:21.353669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.324720Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"bbfbfec7-46bf-4f02-ab85-81cef792d424","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.364627Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:938ed79c4b0eba9c61bb4f55212419dc17964e4246c9d6a5ad33f0cecd9d935d","observation_id":"b11c78d3-4c70-461a-bdad-6b0d36c732ab","resolution":{"observed_at":"2026-08-07T10:55:21.331413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.303015Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"4c5d385e-de67-457a-8fef-cde0d8f32e7d","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.385226Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:81f68965e0c12e94dcb5e73422b6ad0c06ce42937798278673c82f8e9cdd1e7f","observation_id":"ac8777d8-1fcb-4c87-9979-fd85f64a6bfc","resolution":{"observed_at":"2026-08-07T10:55:21.308529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.282795Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"2242eddf-ea2d-4050-9c80-87b65a6cabcb","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.392099Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:e176d83e5c99551381caec58f568c8cd231ffff8b0246b0ac7d059d5759e4441","observation_id":"5f88aa89-5bf3-4ead-bab4-b454b1aa1367","resolution":{"observed_at":"2026-08-07T10:55:21.289513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.263722Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"f0c3352c-702e-4fcd-95cb-6cdc2175aacb","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.398177Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:0e43cb4962856cb21a8bdb4a9a18d3c1204028e636ae8e2c71e81bec6e9b037d","observation_id":"bc5483a2-b170-4143-a810-6eb120b8953f","resolution":{"observed_at":"2026-08-07T10:55:21.269397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.246116Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"5c954b72-2300-4ab0-b16a-b80662f69574","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.402830Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:f3cbeae83cb7442987f2517fb72255cb919c21a2f8502f0675ae0ef44719ca83","observation_id":"87174eda-9204-4f40-ad21-68fde8abdc1c","resolution":{"observed_at":"2026-08-07T10:55:21.251148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.229184Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"1485fd9e-6e9d-45d8-9333-54941daf347b","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.407677Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:47fc03bd45b5d826005b2893c92f304ccaf2131c1c76625ae14bd02d1c5034d8","observation_id":"bdc3f549-f526-4d11-8653-dc3203cafff8","resolution":{"observed_at":"2026-08-07T10:55:21.234174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.212700Z","title":"Please refer to https: //github.com/x-zheng16/RedRFT.git for the document","venue":null,"work_id":"ce63d898-391d-449a-9ce2-f7d0912c84dd","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.414775Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:b0a55813c346965eba92eacf3faf13c0684594608fb27d219fa752f0c255e76c","observation_id":"3a24e7df-fd5c-44df-ba83-91600cc58698","resolution":{"observed_at":"2026-08-07T10:55:21.217962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.193324Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"1687a985-bdc6-4de7-9dd0-beea4bd4ebec","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.419930Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:5dc84f4d9527e04adf694c00ad827d1106810ec4045d597caddf68b1e2f0c6d1","observation_id":"d7fb2682-a2e7-4ba4-af7f-21bf833ea638","resolution":{"observed_at":"2026-08-07T10:55:21.200211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.174024Z","title":"Guidelines: 25 • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"696416b7-ac3d-4fa4-9b84-dda45d5e6e3b","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.425912Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:796d86b416949c5bd866101332dae7a50a885ba26844cf31558db1b2436bccd0","observation_id":"431ab6db-b213-4dd0-aa74-f9bc67e192cd","resolution":{"observed_at":"2026-08-07T10:55:21.180137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.156819Z","title":null,"venue":null,"work_id":"16150d22-c6c3-4046-b86c-451768e9a3c7","year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.444420Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:bf8ca97eba380eb88eac5fe47e658e3a89e94e4e69e4f96ea5cbf822b984e57f","observation_id":"8f459fa7-9125-4e1c-9e78-53da5a87cf8b","resolution":{"observed_at":"2026-08-07T10:55:21.162162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.04302."}