{"as_of":"2026-07-23T11:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84cc28cc128d872cfd857471ae01d5bff63eafa17a4cc57e3ee00175d20d5eef","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T16:25:14.744887Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T05:21:30.132993Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T13:17:39.444002Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2407.21772"},"observation_digest":"sha256:bd2121c278b454b17574ff8d9a59f4223645f3b313cc46e20e180d4103ce0e71","observation_id":"b9b2cbac-3fe4-417f-badf-33106ac3a2bd","resolution":{"observed_at":"2026-05-20T13:17:39.496950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:db12fe02e983af3dfd72b3e500c64dc42892e49d57a0f45ad7dd0bf3ecfaf507","observation_id":"5ac70946-520d-4327-99c8-769fdabb0ffb","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2502.01241","last_updated":"2026-04-13T12:56:05Z","snapshot_observed_at":"2026-07-06T20:30:12.663808Z","submitted_at":"2025-02-03T11:02:30Z","title":"Peering Behind the Shield: Guardrail Identification in Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T03:45:14.234545Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2502.01241"},"observation_digest":"sha256:2848b248e7c55c3814a51369b82ceac7e531372b01a5ec907d10c05680b4d00e","observation_id":"f7ff959f-544e-46e4-85dd-884ef1060c9b","resolution":{"observed_at":"2026-05-23T03:45:21.400762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2506.00166","last_updated":"2026-04-30T20:54:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T19:11:52Z","title":"Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T11:52:36.688263Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2506.00166"},"observation_digest":"sha256:146abad71f30f3190ce58184cddf0e0b0d3b91a59f43e72c82572c90a4fdfecd","observation_id":"c078129b-204c-43d6-86db-6731ea5b733f","resolution":{"observed_at":"2026-05-19T11:53:03.552944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2602.20102","last_updated":"2026-05-21T18:01:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T18:19:46Z","title":"BarrierSteer: LLM Safety via Learning Barrier Steering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T07:02:03.058731Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2602.20102"},"observation_digest":"sha256:68a79e69ab044657da9a46accd13107356bffc737aeb84af1d166d999b9fb369","observation_id":"1e1842fe-dfa8-4f9e-8677-0b6e6b4112da","resolution":{"observed_at":"2026-05-25T07:05:26.753510Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.06233","last_updated":"2026-04-03T13:53:23Z","snapshot_observed_at":"2026-07-06T22:54:44.656835Z","submitted_at":"2026-04-03T13:53:23Z","title":"Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T19:24:54.381722Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.06233"},"observation_digest":"sha256:1904b154bae7fd85111ad3eb466070f5fab0df19677df44aecf6b3996d3a4483","observation_id":"fef350b6-8a75-4a80-86c0-8e20a620f559","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.07655","last_updated":"2026-04-08T23:47:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-08T23:47:29Z","title":"Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:13.339411Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.07655"},"observation_digest":"sha256:46eaf87f969c5404ad3693a4fe8e7b8a01936663cafc05f2d1880ab5f8c5ad10","observation_id":"5f64a7ef-0590-41fc-851d-ad40af7bc9dc","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-07-13T00:19:28.134640Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T18:25:53.037936Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:c670e668df5d8bd224c448d9d00e502673c0ab4b5e265a30d3fb86267903233c","observation_id":"90064aa9-e27c-4ae5-8893-16ab3d6d027c","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-13T00:19:33.861692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-07-13T00:19:28.134640Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-13T00:19:33.861692Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:2a1f8226392035ac3cb348bbd533de377d1e6a53d6c735af14d57708320f2f62","observation_id":"d053ce7b-03aa-4f0a-9ce8-3fa3f2aa411e","resolution":{"observed_at":"2026-07-13T00:19:33.861692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.09189","last_updated":"2026-04-10T10:18:45Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T10:18:45Z","title":"Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:46.600687Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.09189"},"observation_digest":"sha256:28217026bfec812eea64ba726796c5700d88b8fb29cff6478006c9e40dd5a2c6","observation_id":"33dd3198-1d44-4e19-980c-8d1322a4e63a","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.11943","last_updated":"2026-07-06T04:35:13Z","snapshot_observed_at":"2026-07-12T21:41:19.909380Z","submitted_at":"2026-04-13T18:32:02Z","title":"ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:18.594869Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.11943"},"observation_digest":"sha256:c21a8432127622f7c3598d5aec4190eba0b9da711e501c6e56329b9bbb0c2c80","observation_id":"a7e76d4f-867b-4dff-8756-6912b13c9654","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.14414","last_updated":"2026-04-15T20:54:39Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-15T20:54:39Z","title":"The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T13:09:59.573758Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.14414"},"observation_digest":"sha256:1c3b11f2dcff5d1b884ee5a01fb9b445785b9672100eb39106931f32570ea505","observation_id":"f7ca3975-ea2a-495b-ac2d-0bb702c3d5f1","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.16870","last_updated":"2026-07-06T04:39:46Z","snapshot_observed_at":"2026-07-12T19:13:45.039942Z","submitted_at":"2026-04-18T06:40:20Z","title":"Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:24.385051Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.16870"},"observation_digest":"sha256:936d85905742113822001454db1555a0451aecc82e2e078f1f40ee4df91884e9","observation_id":"b5a7804c-8973-4454-8e28-d576a25b6a11","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:0b431c2c99f02f4d10b175c1ab3ec559bc64c391e90e5d5af791ef4d3e9a3715","observation_id":"fae64d48-2412-475e-bd67-dae325f422c9","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2604.18976","last_updated":"2026-04-21T01:58:09Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T01:58:09Z","title":"STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-10T03:06:21.624159Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2604.18976"},"observation_digest":"sha256:cdce53b03b05b1b7552c73f4ef5d3786dedb2cffd95193999d565f7d145b4be4","observation_id":"af06ce84-aa00-4fa1-bdb0-d63225cd369a","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.00269","last_updated":"2026-04-30T22:06:02Z","snapshot_observed_at":"2026-07-06T23:13:42.661364Z","submitted_at":"2026-04-30T22:06:02Z","title":"How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-09T19:45:36.021741Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.00269"},"observation_digest":"sha256:e30b34a1980684f75eaebd01890e20312810a96960135f91f18edec04c4e9414","observation_id":"a4900594-7bda-4347-b54a-777e9ee387b2","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.03226","last_updated":"2026-06-08T16:31:56Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-04T23:30:29Z","title":"Self-Mined Hardness for Safety Fine-Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T18:23:49.808496Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.03226"},"observation_digest":"sha256:898fa573d2b017ab10b4a107e6d0fba5427938bda2b69e9d55f7d41ec271e87d","observation_id":"838155ab-a03c-46e2-8236-3ff8eea07cda","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.03226","last_updated":"2026-06-08T16:31:56Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-04T23:30:29Z","title":"Self-Mined Hardness for Safety Fine-Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T23:56:36.068713Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.03226"},"observation_digest":"sha256:87f58f2cdf2c9873065aa69634cf5eec738470e1e879f5f763daab3f7e654c72","observation_id":"3147ba89-70c5-42c2-ad12-3102ab92cd86","resolution":{"observed_at":"2026-07-01T00:55:12.250651Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.05277","last_updated":"2026-05-06T15:22:40Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T15:22:40Z","title":"GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T16:49:28.684979Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.05277"},"observation_digest":"sha256:b3b4e70abca94357bff4d17c39c698516e6421094487186e977fb0763d6a2daa","observation_id":"4fa2c9bf-fb4e-48f5-8141-764aaa31cca8","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.07982","last_updated":"2026-05-08T16:44:07Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T16:44:07Z","title":"GLiGuard: Schema-Conditioned Classification for LLM Safeguard","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-11T03:19:11.495230Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.07982"},"observation_digest":"sha256:e49dfca8a831b709be5f456de0e2d7a99411a291eade3395e170e8baeac90b97","observation_id":"2b36bcf9-1cb8-4617-9531-ee4770bc2752","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.11268","last_updated":"2026-05-11T21:46:52Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T21:46:52Z","title":"Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T01:48:46.380615Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.11268"},"observation_digest":"sha256:adad65437899c74b992b27e732203f4e92669c508492cd78a37e3bdc208062a6","observation_id":"46b30a19-b46b-4e6a-8f68-58a9746808ce","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.12843","last_updated":"2026-05-13T00:36:47Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-13T00:36:47Z","title":"Bayesian Model Merging","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T20:40:47.471970Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.12843"},"observation_digest":"sha256:e5003b21a97ae59d8bdd73cb50033a5c4b61ae1ef4952412239eda9bc64e211c","observation_id":"342ebf4f-b167-4762-85ff-a5d1164f3824","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.12869","last_updated":"2026-05-13T01:26:06Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T01:26:06Z","title":"Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-14T19:10:29.055784Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.12869"},"observation_digest":"sha256:4ec7085790b2efb6f22f036b66697f22397fcd7d063d4199dfe3feed558f26b9","observation_id":"363a5dc2-faac-4a06-95a5-7f16f798f2d0","resolution":{"observed_at":"2026-05-17T16:25:15.056079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.17329","last_updated":"2026-05-17T08:35:38Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:35:38Z","title":"LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T23:42:58.135553Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.17329"},"observation_digest":"sha256:b1fc4007dc4450b66a4a00eefca0805b3ae955c2856174ac39918c3e87cc83ed","observation_id":"70017aed-3fc4-4d7e-9574-902e1121a368","resolution":{"observed_at":"2026-05-19T23:43:17.756873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.18549","last_updated":"2026-05-18T15:29:04Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:29:04Z","title":"Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T10:54:20.285841Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.18549"},"observation_digest":"sha256:b09f1ebf521c49f81595ed7c1f77a653063547bce020cca358d89fde6071cef9","observation_id":"c7e1a42f-efed-4a59-95b5-94d2cb1247a0","resolution":{"observed_at":"2026-05-20T11:03:13.902127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.20351","last_updated":"2026-05-19T18:05:51Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:05:51Z","title":"Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:43.363709Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.20351"},"observation_digest":"sha256:d7f1ce5456ab2ef490fb8f1d9c3c3e2e54b4427bfafafae1ddf821a7ce9d509f","observation_id":"0145f2ca-6abe-4c53-8273-9be1ea18f396","resolution":{"observed_at":"2026-05-21T07:39:48.497203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.23974","last_updated":"2026-05-13T14:18:29Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-13T14:18:29Z","title":"AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T21:28:25.577739Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.23974"},"observation_digest":"sha256:bb7c896d9162465913521023a9e3a9a7178af285718727633e846d8580966b81","observation_id":"9324d343-6067-4d1e-9dc2-9980417d560c","resolution":{"observed_at":"2026-06-30T21:35:04.723120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.24834","last_updated":"2026-05-24T02:58:21Z","snapshot_observed_at":"2026-07-06T23:34:52.129354Z","submitted_at":"2026-05-24T02:58:21Z","title":"Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T00:29:50.433221Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.24834"},"observation_digest":"sha256:f3d0099114f9feea59704c57b5dce45079afaf436ba3f3568f7d49b8094ce3b7","observation_id":"8b3ac29c-b960-4245-90aa-9d04b50c75a5","resolution":{"observed_at":"2026-07-01T16:35:50.600485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-12T23:33:25.778345Z","title":"Monte Hoover, Vatsal Baherwani, Neel Jain, Khalid Saifullah, Joseph Vincent, Chirag Jain, Melissa Kazemi Rad, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28830","last_updated":"2026-04-10T06:55:07Z","snapshot_observed_at":"2026-07-12T23:33:25.484953Z","submitted_at":"2026-04-10T06:55:07Z","title":"Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T23:33:25.778345Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.28830"},"observation_digest":"sha256:79e0f07396ccc1d2937392808a468e21ae0c6b0e54667ab72103c9e001348ec6","observation_id":"63c79d65-3c52-414a-a158-c32329a27542","resolution":{"observed_at":"2026-07-12T23:33:25.778345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2605.29659","last_updated":"2026-05-28T09:21:42Z","snapshot_observed_at":"2026-07-06T23:39:05.858969Z","submitted_at":"2026-05-28T09:21:42Z","title":"Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T09:11:58.843585Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2605.29659"},"observation_digest":"sha256:9ca931a3be76b0997fd281fd6d397990879f59af53ffaf1fa38135b43ff173cd","observation_id":"f2636ba3-ff4c-4d7d-92c3-6fd7a591f264","resolution":{"observed_at":"2026-06-29T09:13:16.016927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.02959","last_updated":"2026-06-01T23:29:58Z","snapshot_observed_at":"2026-07-06T23:43:17.879245Z","submitted_at":"2026-06-01T23:29:58Z","title":"Gate AI: LLM Security Benchmark Evaluation Methodology and Results","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:05:08.411286Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.02959"},"observation_digest":"sha256:837a4cf5232dafaabd661a9b1849a524c0d598a201a4aa7d161113d66a9edb81","observation_id":"b5511fb2-f112-4eb1-b316-e69c7ecfcd4e","resolution":{"observed_at":"2026-07-01T22:46:19.185026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.11949","last_updated":"2026-06-29T18:06:38Z","snapshot_observed_at":"2026-07-06T23:50:58.297354Z","submitted_at":"2026-06-10T11:24:25Z","title":"Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T10:19:49.060228Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.11949"},"observation_digest":"sha256:5144f036ed743423011d4bc99afb00bbc1624fa0a7b9b7801e2869cfd19bd6d0","observation_id":"b955e541-c739-4445-986c-5af19cf2ae5c","resolution":{"observed_at":"2026-07-03T09:47:59.639874Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.11949","last_updated":"2026-06-29T18:06:38Z","snapshot_observed_at":"2026-07-06T23:50:58.297354Z","submitted_at":"2026-06-10T11:24:25Z","title":"Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-01T07:54:38.523190Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.11949"},"observation_digest":"sha256:a0fcca552e9e6a16bdac31df95c56969a552991fe77a4ee25fbfefa76247e905","observation_id":"389737a1-8a89-4d75-8470-71c2176a8d47","resolution":{"observed_at":"2026-07-01T07:55:30.519757Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.17628","last_updated":"2026-06-16T07:33:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-16T07:33:53Z","title":"OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-06-27T01:07:49.603969Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.17628"},"observation_digest":"sha256:931269c4c7f41e4676cd1bdf9ac2c89e66dc7d5a16d16ebdbfd8a20df7849bfc","observation_id":"5e086606-93da-4a17-88d3-f3aead05ecda","resolution":{"observed_at":"2026-07-03T20:48:56.463623Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.19887","last_updated":"2026-06-24T07:42:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T07:46:18Z","title":"FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:40.088809Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.19887"},"observation_digest":"sha256:ffdece95274d3d8dca891ecde78f0fcd9de1a5329f4071edf005e8d11ecaa984","observation_id":"9ed39ab4-125f-49fb-8297-fcd1b77fa33e","resolution":{"observed_at":"2026-07-04T04:09:34.766057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.20508","last_updated":"2026-06-18T17:25:38Z","snapshot_observed_at":"2026-07-06T23:55:38.979306Z","submitted_at":"2026-06-18T17:25:38Z","title":"What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T17:43:17.000740Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.20508"},"observation_digest":"sha256:b3ee865ffda11b1921c954e613c18c39604734ee91234fb762091dbabbad271c","observation_id":"2d3f59e9-38b7-4943-9475-8c00d7400c23","resolution":{"observed_at":"2026-07-04T03:39:31.064546Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.20626","last_updated":"2026-05-26T17:35:31Z","snapshot_observed_at":"2026-07-06T23:55:43.830896Z","submitted_at":"2026-05-26T17:35:31Z","title":"Efficient Safety Benchmarking via Item Response Theory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T15:51:00.484343Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.20626"},"observation_digest":"sha256:a995f7107d19a4ebfae612f2ba55fa973d350207f66146e29b7798cb6c99eb29","observation_id":"5edbb1a7-087c-4376-99c8-5b0a8d6c3b0a","resolution":{"observed_at":"2026-07-01T15:55:48.983903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.21296","last_updated":"2026-06-19T10:19:54Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:19:54Z","title":"Discriminatory Compliance: How LLMs Answer Queries from Protected Groups","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-06-26T12:58:09.227648Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.21296"},"observation_digest":"sha256:0ab763f2f2ebbe1b6adaa71076df529de4016fb976adafe887697e6ce08cb6be","observation_id":"2fb5785a-726f-4627-a9b7-b630cc353306","resolution":{"observed_at":"2026-06-26T12:59:29.384777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.25034","last_updated":"2026-06-26T07:24:58Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:00:08Z","title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T00:03:27.948225Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.25034"},"observation_digest":"sha256:f1898a85db02cde371dd2978e0ffa4426e9cd722f0534e68dfe72be2d1198a02","observation_id":"7f489fbb-cfb8-4d29-bcb3-7954ac15773f","resolution":{"observed_at":"2026-07-04T16:59:58.608983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.25034","last_updated":"2026-06-26T07:24:58Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:00:08Z","title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:16:19.502837Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.25034"},"observation_digest":"sha256:44a06435473bf07a5cd4c441ffca07582f0f02c884b1a887539c51e06b5ea520","observation_id":"07667cd3-ac62-4caf-8395-b15867cd85d0","resolution":{"observed_at":"2026-06-29T18:03:48.820968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.25396","last_updated":"2026-06-24T04:46:42Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T04:46:42Z","title":"Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T21:11:37.666975Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.25396"},"observation_digest":"sha256:57907c5f214d76c25d102efd1a439d7cced59fc7308e2407c0dc177e50d9c5ec","observation_id":"48ec0eb3-4e0b-44a7-b56f-c20f65a95c89","resolution":{"observed_at":"2026-06-25T21:18:24.045558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.25487","last_updated":"2026-06-25T02:04:55Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T07:14:17Z","title":"How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T20:56:18.687903Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.25487"},"observation_digest":"sha256:872c619803f6b01c0b9ed2fd2dd143cc7ec3e46592588fb73c706d532d95584e","observation_id":"3218c63f-1684-4e82-bbd2-ab1414dd18fb","resolution":{"observed_at":"2026-07-04T20:00:07.911016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2606.25487","last_updated":"2026-06-25T02:04:55Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T07:14:17Z","title":"How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:21.279142Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2606.25487"},"observation_digest":"sha256:3f11f5416805575f4130f77acf94e6b6e8262d48f52ca17b24247b4a904780d9","observation_id":"e1539bfc-f4fc-4e8a-bf63-7eb4381e87d0","resolution":{"observed_at":"2026-07-04T13:09:51.041176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":"2406.18495","doi":"10.48550/arxiv.2406.18495","metadata_source":"pith","pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","venue":"cs.CL","work_id":"3aa75d7c-4d7b-4965-af9b-aeeea4f78fa1","year":2024},"citing_paper":{"arxiv_id":"2607.02079","last_updated":"2026-07-02T12:21:16Z","snapshot_observed_at":"2026-07-07T00:07:33.184524Z","submitted_at":"2026-07-02T12:21:16Z","title":"HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T14:38:55.045628Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2607.02079"},"observation_digest":"sha256:86d8523824f67b89b495df83a79bd344b304c0b2f302d69c06ac628dd0fba52f","observation_id":"77399629-29a7-41ed-b080-477d92753fab","resolution":{"observed_at":"2026-07-03T14:48:32.681628Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"WildGuard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of LLMs.arXiv preprint arXiv:2406.18495, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-07-16T23:19:48.913901Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:dc6cfb346f3abb06aff69f1a50d77bfe931679c0963a1b05c00e896e4b09a922","observation_id":"98e0a8fc-8db3-4ed7-b23d-4e9e6490c449","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.18495/citation-record","integrity":"/paper/2406.18495/integrity","json":"/paper/2406.18495/citation-record.json","paper":"/paper/2406.18495"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:d66b051f793810f3ca36c1e4517740a654acb801d099766f92a9bdeb2b9e907e","observation_id":"a331e6aa-2851-4439-819b-9d90f00f4076","resolution":{"observed_at":"2026-05-17T16:25:14.794770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 3 model card","venue":null,"work_id":"c7ab4b73-84eb-419d-9567-20e065974941","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:8487a56b5620755c7548dd1bd11114f8acd360f32ea63d58644f6a83633b750a","observation_id":"25708366-4fa9-43e8-96fe-01986aa66005","resolution":{"observed_at":"2026-05-17T16:25:14.941524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"9f159deb-2679-42f7-b329-e85ade88cb92","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:06d790de2aeedacbdb88f2144837097d02bf6a40f7e9908fa39aa8bea79cf6e1","observation_id":"d872d819-978c-4829-b6fe-cbf6ba537626","resolution":{"observed_at":"2026-05-17T16:25:14.997187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":null,"work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:1b2fc2c8a99efea45355a46ae85f20a6f90b9ba4ad6cd65a0801780a9c8b7d31","observation_id":"07a1da5b-b4f0-44e8-b987-1a99bf9035de","resolution":{"observed_at":"2026-05-17T16:25:14.801617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:03:45.699690Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":"6b9cf002-ab59-4c61-ae20-2d2f7b0eecaf","year":2022},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:2b1891c30597c817e19693aa68441434e35ac0975d95e3be3ab8a0641244ea85","observation_id":"f00169e0-0116-4e04-a219-d8721967e6ba","resolution":{"observed_at":"2026-05-17T16:25:15.003595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-06T09:11:34.079144Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-11T03:27:46.681766Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:4f6f8fc526ef6bc0f65440a7517170c6b9da3fb965888ec95b10430c45c86385","observation_id":"167aa439-8561-44a3-b238-35fe66429d1d","resolution":{"observed_at":"2026-05-17T16:25:14.811728Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":"2309.07875","doi":"10.48550/arxiv.2309.07875","metadata_source":"pith","pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions","venue":"cs.CL","work_id":"4f3956ef-5c1a-4536-8f08-ab1c9a6ce6d5","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:bb92cbefd69ab523187d43a22d024f9f0417ffd51243fd8ff7fb7cfcbb68faf6","observation_id":"6e6e61f8-16bf-43d6-bf13-78e229ebf1ac","resolution":{"observed_at":"2026-05-17T16:25:14.819912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":"6422ddfd-2ce5-414e-9027-d98f96e20d71","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:d65b679e9b8cf06f0f7f86225d291093ec7e26f3764db28d596fae935124a674","observation_id":"f95ec4dc-0b2c-44fc-ad56-92978e0a93ee","resolution":{"observed_at":"2026-05-17T16:25:15.012511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-07-06T16:35:40.224690Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2310.12773","doi":"10.48550/arxiv.2310.12773","metadata_source":"pith","pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","venue":"cs.AI","work_id":"45bf2da5-62a0-441e-b0fc-77d659b681db","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:3fb30bed9b05805d6fac3352a19b8524875ba384b95cbe08ab925d8b895bf5bb","observation_id":"e877ed7f-a5d9-4da8-aba0-e684b1d70f20","resolution":{"observed_at":"2026-05-17T16:25:14.826599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The measurement of interrater agreement","venue":null,"work_id":"15d67336-16a3-4a3c-a12f-63e0dac457ab","year":1981},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:4769e7abdcb5da51eb2ebdaf2994b4e6186fc7a20d6a3191e4c5878938ad21a3","observation_id":"79fc2aab-b7be-4f85-bcf3-e3a4d415dcf5","resolution":{"observed_at":"2026-05-17T16:25:15.018502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":"2209.07858","doi":"10.1136/bcr-2013-201554","metadata_source":"pith","pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","venue":"cs.CL","work_id":"1aabd84d-3779-4ba9-ba2f-15ce264a9b1e","year":2022},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:93187d42cc42ddb543f5656344c79a07d2e0fc02ac3a3871d78e2ad68ae8698d","observation_id":"dfaf4668-8bf9-4822-ba09-f582d5242f96","resolution":{"observed_at":"2026-05-17T16:25:14.832759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realtox- icityprompts: Evaluating neural toxic degeneration in language models","venue":null,"work_id":"c380d9c4-d17e-4285-ad89-987cdcaf2309","year":2020},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:d1c13c7f873113fe93e543398cde7c09aabfacd9631595dee5089e42db05268a","observation_id":"ff95bfa7-c8e3-4239-a9cf-30004be2e4c6","resolution":{"observed_at":"2026-05-17T16:25:15.024027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05993","last_updated":"2024-09-11T14:42:29Z","snapshot_observed_at":"2026-07-06T17:57:31.912970Z","submitted_at":"2024-04-09T03:54:28Z","title":"AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts","version":2},"cited_work":{"arxiv_id":"2404.05993","doi":"10.48550/arxiv.2404.05993","metadata_source":"pith","pith_arxiv_id":"2404.05993","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts","venue":"cs.LG","work_id":"1ccd11c8-18f7-4764-989f-140f3f59c730","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2404.05993","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:62d4d9f89ebbacfa6d5771eed93275309fcb40df0ac94dfec42df592ad220539","observation_id":"a6f947b2-4071-4765-94e4-06c4f286006f","resolution":{"observed_at":"2026-05-17T16:25:14.838539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ruddit: Norms of offensiveness for english reddit comments","venue":null,"work_id":"1316c7af-a121-404a-93e0-c4b562af1cfd","year":2021},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:f5155d77cda750f10d80cafa16aec63a9fd9ae530e9e78fb8585090119734ed2","observation_id":"977d9e24-0485-4c73-821a-479f1350a22c","resolution":{"observed_at":"2026-05-17T16:25:15.029413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12001","last_updated":"2023-10-09T22:57:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-21T03:35:06Z","title":"An Overview of Catastrophic AI Risks","version":6},"cited_work":{"arxiv_id":"2306.12001","doi":"10.48550/arxiv.2306.12001","metadata_source":"pith","pith_arxiv_id":"2306.12001","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"An Overview of Catastrophic AI Risks","venue":"cs.CY","work_id":"8ccc2a63-3f9c-44b9-9c5a-091313da3304","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2306.12001","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:22b33fd6427da095601b25d39ef0f2b1fa3041a5a70fbe672545ddae4049e4e4","observation_id":"2ec2ec9d-f009-48aa-b07e-d632e06d2172","resolution":{"observed_at":"2026-05-25T05:03:47.506388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":"2312.06674","doi":"10.3390/info16050365","metadata_source":"pith","pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":"cs.CL","work_id":"93844332-869b-448c-a1be-35466150b1b2","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:3333084c51cf04b9305dcdfe5b041c0c13444bfd883130db3e9d5cc34114558d","observation_id":"72db41cc-e8d5-43e0-9cc8-5b8bcb80f5e0","resolution":{"observed_at":"2026-05-17T16:25:14.849301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":"b7ada145-8987-4157-9548-48c752e66381","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:157c5c620aaf672bf6c8f4ed425fbda0d2454948a21a84fb2d82a24167919c3e","observation_id":"23daa911-e05d-4c4f-984d-71eb7289922e","resolution":{"observed_at":"2026-05-17T16:25:15.038222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"5914442b-5997-4d36-9788-21d89bf8fcd2","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:759f0e6c8314a5454cb4a2ef562e778ebd4fd0b28f0a1d697ed4d38be0662dd9","observation_id":"9c4b6b5a-df39-439b-a808-9646388d6191","resolution":{"observed_at":"2026-05-17T16:25:15.041703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b97339ca-d73b-4a1d-8583-e1d3268a7895","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:f9051ac10b9ac10eab856beb2811853d9db89a657a1418b7f64ba575b1aad7bf","observation_id":"a426fb12-99e2-4cb2-8c5d-2953105d1293","resolution":{"observed_at":"2026-05-17T16:25:15.045416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18510","last_updated":"2024-06-26T17:31:22Z","snapshot_observed_at":"2026-07-06T18:37:26.588451Z","submitted_at":"2024-06-26T17:31:22Z","title":"WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models","version":1},"cited_work":{"arxiv_id":"2406.18510","doi":"10.48550/arxiv.2406.18510","metadata_source":"pith","pith_arxiv_id":"2406.18510","snapshot_observed_at":"2026-07-10T15:37:20.409076Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models","venue":"cs.CL","work_id":"e435e1d0-3a48-4281-9add-80b0725037b7","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2406.18510","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:9a22a2c57d147eaa96e0df5964e4e43d7388576e62c155e729ff190dc10634d0","observation_id":"3ab805f5-3864-4c30-9366-e43732a29c5a","resolution":{"observed_at":"2026-05-17T16:25:14.855330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A new generation of perspective api: Efficient multilingual character-level trans- formers","venue":null,"work_id":"27781163-7c80-45e3-a73d-7aeaaf39de14","year":2022},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:4d2d7a1010e5f37c814fd160e9a79093357a0432f3306b2bb0a582dd6d5a5a84","observation_id":"2c9d52a0-e208-4458-bc21-f7cf34f28937","resolution":{"observed_at":"2026-05-17T16:25:15.051572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-07-06T17:26:59.606509Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":"2402.05044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-07-04T04:09:34.829805Z","title":"Salad-bench: A hierarchical and com- prehensive safety benchmark for large language models","venue":null,"work_id":"d5b5f02c-8f82-442b-b1ae-b5ea4d849585","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:9f67db19af6d5ae00251e286bfbe7f2dc3f846bbbb25c0d2dbee0a2039057266","observation_id":"0f840343-e05c-4f98-b0ef-1094684dc243","resolution":{"observed_at":"2026-05-17T16:25:14.860999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17389","last_updated":"2023-10-26T13:35:41Z","snapshot_observed_at":"2026-07-06T16:38:56.540232Z","submitted_at":"2023-10-26T13:35:41Z","title":"ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation","version":1},"cited_work":{"arxiv_id":"2310.17389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17389","snapshot_observed_at":"2026-07-03T14:48:32.654187Z","title":"Toxic- chat: Unveiling hidden challenges of toxicity detec- tion in real-world user-ai conversation","venue":null,"work_id":"934340c1-de04-43a3-af48-deb728f15d44","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2310.17389","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:5e2e2122c0e388cbda46347d94d6c30d915b938ebf64e15efc5079a0aa8d4e57","observation_id":"4ae480b6-9c61-470c-a90d-6399246e790d","resolution":{"observed_at":"2026-05-17T16:25:14.866587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A holistic approach to undesired content detection in the real world","venue":null,"work_id":"44a44e88-6323-46f0-a467-61b723521fca","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:747227aedc7fb6654c0ed4dfa8ec65f60fd3b8149c40eb817599a54030c05fbd","observation_id":"0f3d717f-0b7a-4062-97c9-c082bb06011d","resolution":{"observed_at":"2026-05-17T16:25:14.931058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-07-10T15:27:20.028353Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:0d13dc2b70bfc6df1af3a9bf2c87aec076f9b053625a947d9489b4869630150a","observation_id":"ec39ab30-010f-4947-a3c2-01a92ceac38e","resolution":{"observed_at":"2026-05-17T16:25:14.871506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta llama guard 2: Model cards and prompt formats","venue":null,"work_id":"def7e8ba-ea9f-462a-93e9-9c509fc1ba7c","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:2fd5c41a40bb645bd11047fd93161daad4b16619723a2932b29c8be843ce02dc","observation_id":"2763d7aa-27f6-4a31-bef5-7ff2635145be","resolution":{"observed_at":"2026-05-17T16:25:14.938266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.8364980","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:52:18.833108Z","title":"Chenghaomou/text-dedup: Reference snapshot, September 2023","venue":null,"work_id":"344a20df-0365-456a-99d4-43bdc0ba71c6","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:56e4c19b3e882387d3b70165bfece7818c39e58e0a012f243cfd5e66198505a7","observation_id":"8e2fb651-e175-4bc0-aa69-5e71125b37b3","resolution":{"observed_at":"2026-05-17T16:25:14.787804Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai moderation api","venue":null,"work_id":"ad283212-f142-4686-81e9-6e48ccb9dc9c","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:8c1c364a1b7beecd55e9c9e68e07fb2417bfd7b071a71c61eb033316b249d49a","observation_id":"ffb72553-54ff-4228-bac8-3028f477a6b2","resolution":{"observed_at":"2026-05-17T16:25:14.944696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14454","last_updated":"2021-09-24T16:36:35Z","snapshot_observed_at":"2026-07-06T09:16:23.546389Z","submitted_at":"2020-04-29T20:02:58Z","title":"SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification","version":2},"cited_work":{"arxiv_id":"2004.14454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.14454","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A large-scale semi-supervised dataset for offensive language identification","venue":null,"work_id":"bb1a9695-10d2-4428-8d22-7897562b79d7","year":2004},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2004.14454","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:4119124c2582606cb60d430ca13c9ae2d6af63716646b1c867e13e115bc9d845","observation_id":"90f0eb21-5407-40b9-92ec-2261ac57a641","resolution":{"observed_at":"2026-05-17T16:25:14.876735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":"2308.01263","doi":"10.48550/arxiv.2308.01263","metadata_source":"pith","pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","venue":"cs.CL","work_id":"bd953600-1547-4c1e-ade7-219a9f7cfe7a","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:6449b19bcc0f58179375467ea9d548e1220e1042be3fc18b6ffe8e857f5bc4d5","observation_id":"00e99c7d-61c7-475f-b471-5822ce9fa71f","resolution":{"observed_at":"2026-05-17T16:25:14.882872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10436","last_updated":"2023-04-20T16:27:35Z","snapshot_observed_at":"2026-07-06T15:17:59.640907Z","submitted_at":"2023-04-20T16:27:35Z","title":"Safety Assessment of Chinese Large Language Models","version":1},"cited_work":{"arxiv_id":"2304.10436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.10436","snapshot_observed_at":"2026-07-03T01:07:30.335333Z","title":"arXiv preprint arXiv:2304.10436 , year =","venue":null,"work_id":"9d688004-3580-442d-9134-7139a3f81493","year":2022},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2304.10436","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:4fe97f1b50421a627daca08cb7b6f20f40b5c8bcd71ce33822d873191a4b6c59","observation_id":"3ec50fd2-280b-4c61-8255-dc92afc44ef1","resolution":{"observed_at":"2026-05-17T16:25:14.891841Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"982729b0-5e49-49a7-babf-2cc9e2ea443d","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:dc79a0d0c330ba4f99fe5df4c2a956137daa6fe9b5142ced768d33ec646f6026","observation_id":"10652d37-b599-46f3-819b-5ee9cd9847f8","resolution":{"observed_at":"2026-05-17T16:25:14.957540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":"13a20ee7-d35f-4c98-bb5d-e2ea594a11aa","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:43947705d657f23fa0746a60aad92aeae5d8e7c7a74a367acb0fe3a1e69c6537","observation_id":"7c4c8529-f4d9-4f04-92f0-30d1272e1bc7","resolution":{"observed_at":"2026-05-17T16:25:14.961214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08676","last_updated":"2024-06-24T08:50:22Z","snapshot_observed_at":"2026-07-06T17:59:29.408432Z","submitted_at":"2024-04-06T15:01:47Z","title":"ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming","version":3},"cited_work":{"arxiv_id":"2404.08676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08676","snapshot_observed_at":"2026-07-04T04:09:34.807178Z","title":"InProceedings of the 2013 conference of the north american chapter of the as- sociation for computational linguistics: Human lan- guage technologies, pages 746–751","venue":null,"work_id":"6a1434c5-1f37-43e0-a5e6-01eafe2534c7","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2404.08676","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:152d60f7771a8947bfea2c42ca5d8c0ba75746a8289608794aa34829898a9619","observation_id":"6d4c4929-b179-4f63-8bb9-a2c6c108bf7e","resolution":{"observed_at":"2026-05-17T16:25:14.898535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":"880c8731-d932-4c0f-9dd5-3cfdf30bfa41","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:126490dae2d27d8ffd6d33945a7581a38d7ffe0a6fc7294011bd5067472d579d","observation_id":"3090015e-366a-49b9-b1e8-71a6128993d6","resolution":{"observed_at":"2026-05-17T16:25:14.967679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08370","last_updated":"2024-02-16T09:42:19Z","snapshot_observed_at":"2026-07-06T16:47:28.959555Z","submitted_at":"2023-11-14T18:33:43Z","title":"SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2311.08370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08370","snapshot_observed_at":"2026-07-04T03:59:32.652255Z","title":"arXiv preprint arXiv:2311.08370 , year=","venue":null,"work_id":"640cffcd-ef2c-4e9c-9585-872794809e9e","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2311.08370","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:db61918a7240eee0f04098f62498df114c6ad801eb1b04dd96325b3a12da9715","observation_id":"4f5f243a-d99e-431f-9ae2-b485bdeb8495","resolution":{"observed_at":"2026-05-17T16:25:14.904441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12241","last_updated":"2024-05-13T20:46:10Z","snapshot_observed_at":"2026-07-06T18:02:15.186390Z","submitted_at":"2024-04-18T15:01:00Z","title":"Introducing v0.5 of the AI Safety Benchmark from MLCommons","version":2},"cited_work":{"arxiv_id":"2404.12241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12241","snapshot_observed_at":"2026-07-08T13:54:58.614474Z","title":"Introducing v0.5 of the AI safety benchmark from MLCommons","venue":"cs.CL","work_id":"cf3860a3-9e35-40de-aba0-115059ef292a","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2404.12241","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:159bfe53195834d2d245d272076d04318bddbf289f1a666785b83e1267f6e1da","observation_id":"c95dd37a-65d2-4051-8125-61a75faa3f98","resolution":{"observed_at":"2026-05-17T16:25:14.910778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do-not-answer: A dataset for evaluating safeguards in llms","venue":null,"work_id":"1826ebec-dbe7-4a35-8aaf-e256b7e5c16b","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:2e8fb869051d28a77e698b81797a10abb4faf94511a2453843b8f1bfdd986a55","observation_id":"17ade557-0482-4cf2-ac20-62bb6333c0e0","resolution":{"observed_at":"2026-05-17T16:25:14.977026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":"2112.04359","doi":"10.48550/arxiv.2112.04359","metadata_source":"pith","pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Ethical and social risks of harm from Language Models","venue":"cs.CL","work_id":"b4ce1c45-ef69-445a-a872-dbb785b485e9","year":2021},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:4016d081dd070300cb5d4e50e77fa365490898642c9425ff0d05be5728d54839","observation_id":"5a766751-fc22-4886-b1ca-c12b7d1b5dbe","resolution":{"observed_at":"2026-05-17T16:25:14.916284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:50:40.702477+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:50:40.702477+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semeval-2019 task 6: Identifying and categorizing offensive language in social media (offenseval)","venue":null,"work_id":"c8a2fc1f-b01f-4c67-8074-65aa9915c0ac","year":2019},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:5fb075d6c2ea3211be0bf3df524ec58d5adddfaec68d176a1e3824ff6bb89c03","observation_id":"7df29d8a-16a1-4808-9cec-10210980b32d","resolution":{"observed_at":"2026-05-17T16:25:14.983928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:02:41.647384Z","title":"Wildchat: 1m chatgpt interaction logs in the wild","venue":null,"work_id":"a4b1cf72-1afd-4de8-8234-5b84a581112f","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:988109305c021316638b72143ed93d6b089736e418a540baec74e7d9040bbcf8","observation_id":"ef6c1793-6a50-4ffe-9a18-c2cadea13613","resolution":{"observed_at":"2026-05-17T16:25:14.987260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"P Xing, Joseph E","venue":null,"work_id":"71c96a20-8c7a-427d-a1cf-d0ec96a70ecf","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:dc2873f2d65ab147af5d7382002cd5721bf689b219b61a6f0f9b7a99de972d59","observation_id":"d093f015-3bf6-4ab7-947f-abaab3128c82","resolution":{"observed_at":"2026-05-17T16:25:14.990162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"84ecadbf-565a-4a1e-b618-9fc305ddd074","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:146e4324fd99829e53149770c731071546def10b39a079cdb554c26265e2f89e","observation_id":"10e3fb7d-8348-42b4-aa94-8bc3a8fa6194","resolution":{"observed_at":"2026-05-17T16:25:14.993697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-11T02:47:49.837877Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:30bfc63b420dca1db95b39d7df8fcc577c81a8108fdde4385dc1da0521184a46","observation_id":"78e3adc0-7411-4d4b-96d4-4c86ceeeba18","resolution":{"observed_at":"2026-05-17T16:25:14.923012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Request","venue":null,"work_id":"266b203d-089c-436f-9178-f57957e3514d","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:34dbf00f51c02fd17599dac8be3c68d5fb3426b4dad2a827de636b519ec123fa","observation_id":"e2f01e02-8ced-4cb0-9e6a-2ec177ccb688","resolution":{"observed_at":"2026-05-17T16:25:15.006141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"eb647fb9-8df9-4676-8c5c-8e127a9d30d4","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:78aa9226931c76832c02e6fd35e448ee4a00934155fda502a1d4960321b875b7","observation_id":"65cb4354-6cc8-4bd2-b9cc-70ebf1eda3db","resolution":{"observed_at":"2026-05-17T16:25:15.009227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"879c855f-59e7-4773-85a5-3c247ed3c5ce","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:de91ba902e83af615e1756d5758939971ba04506928fd231f32ceb717ec99e50","observation_id":"9aba8f34-f3f0-46ed-86b9-834bf9cfcb23","resolution":{"observed_at":"2026-05-17T16:25:15.015262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"0214febe-312b-4dbb-98f6-6e97aa7ed0b8","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:29bf2951901f72fee5a0d8c50476e27a973458dfa2859b10e382a14c49957a44","observation_id":"b1904c56-0eef-4458-9a7c-6d062f2d789e","resolution":{"observed_at":"2026-05-17T16:25:15.021187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"14cbdf19-ad45-4d5b-981d-05e1f65d3583","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:bd73eee8239046469c4609fc418a2e78948ca832d96742db3e444f7c9673f4ff","observation_id":"1e0f9a9a-ef06-4b6a-a57e-7843932117aa","resolution":{"observed_at":"2026-05-17T16:25:15.026686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"ef0aab3c-b594-40fb-9663-97c1e2fd1f1c","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:fd6d5e5a1519b6adcd5e1ad28362d5e5bb8fd7b76dd7ac23e7266e4775cd608a","observation_id":"a9a5ad45-6336-48c8-bfb9-9ea6b2735fcf","resolution":{"observed_at":"2026-05-17T16:25:15.032130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human\" for the human response, and key","venue":null,"work_id":"cebdacba-8b57-484f-8e5e-91499743a9b9","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:403edaa35ab52532575f30ae883ded63e7056618638e6e8a24a95a8c1ca0d1b2","observation_id":"e00e7850-a015-49d3-8d96-71f8cf43af09","resolution":{"observed_at":"2026-05-17T16:25:15.034827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"8e2cab17-46a1-4519-9b8d-5fab985001b9","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:aa0a8e37fedb3fa3ddcd1d48a4c9e46b6d19c13e2376171193b87abd213d4f61","observation_id":"8d0d9d3d-b4bc-4772-82ee-cce4fc887e31","resolution":{"observed_at":"2026-05-17T16:25:15.048495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"f36ac274-e2cd-492d-8a28-bfda94fbf873","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:59e2803554ea681adbc35a6bb40f207ef4085df63fc4cd8b7bdcdfcc697807c6","observation_id":"9344b7f3-8f45-4490-b473-105aff195f39","resolution":{"observed_at":"2026-05-17T16:25:15.054789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"2ef597ec-3406-41f4-9bbf-8a95aec7a9d2","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:d9b97275e3441e6f5df66bfd94bdc885c7885b65469a42d771e585851b328faf","observation_id":"b7bc28d3-3f3b-4c1b-9af9-f8626a35b238","resolution":{"observed_at":"2026-05-17T16:25:14.926927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"examples","venue":null,"work_id":"93fc3211-5a8f-453f-8bfa-1e19e662fad2","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:109d845cbc5d0db98d07f1a127bf697a6403cbb8c43a7000293095a4ff1d034d","observation_id":"fed3b2a0-8f3e-4bf9-9f27-f5456269f7e0","resolution":{"observed_at":"2026-05-17T16:25:14.934699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"examples","venue":null,"work_id":"1c5b507d-3e8a-4136-a98c-5cec3b91e63e","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:9ea3b08386fd65b428e36b7df92bbf588c77ae7af5aa9544e11d5317d7199977","observation_id":"49056f99-63b9-403e-978c-cd1953575d99","resolution":{"observed_at":"2026-05-17T16:25:14.948025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assistant","venue":null,"work_id":"1f5f6330-fe67-4c3b-a442-345b7ce6febf","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:181f07f3fa5dfa48271204212be504ff87607541814c39a55da2ed282a4707f9","observation_id":"1b91cf77-0732-4c56-8097-cd778d797921","resolution":{"observed_at":"2026-05-17T16:25:14.951161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b5fcba68-94a9-4898-ab98-c626e06a308c","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:af7283124afc35718833c059d7a2ae779ca83373367172f575bd5e577d943bd9","observation_id":"eeb36b6e-1a01-4a5f-9fc6-6d8a05725009","resolution":{"observed_at":"2026-05-17T16:25:14.954285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9463a99a-c2e7-418c-a882-faa4f3ba473a","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:aecc7607735e142e4c1d280221959d62e46c9c26dcf1ebba0ce119e333908372","observation_id":"4f045e81-56a9-4fd7-a01d-df436f867b8c","resolution":{"observed_at":"2026-05-17T16:25:14.964337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Needs Caution","venue":null,"work_id":"ecf58cb6-46e9-48fc-8d18-673d921cb561","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:076f721f8a496f9550ce7d297c06ec0f6a495647739834277ea2b51010ca1d95","observation_id":"93ed501b-c30d-4845-b2f5-677fa58deee7","resolution":{"observed_at":"2026-05-17T16:25:14.970738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6b54aada-67c1-4c41-bde6-9e7f25141a79","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:7642cd0dfd51a3b7e194391226c366ec0f337a5b3707522572ccef59ef8e05a4","observation_id":"21377d56-d16f-4cca-94b5-e3a109ecf8ae","resolution":{"observed_at":"2026-05-17T16:25:14.973687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"616e6b14-3d1e-4a25-9f6e-6ac095cc6d12","year":null},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:53bc0dd66ad7b8d4a39130d7ce3981eb99845af98a25d0736f16a267df1d7ae2","observation_id":"64a0daf6-40a9-49cc-994a-77e715d78efd","resolution":{"observed_at":"2026-05-17T16:25:14.980351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As an AI language model, I cannot","venue":null,"work_id":"969b25e8-df58-4418-ab58-21fc65619fdf","year":2021},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:f16a13002f7dc1a39672f808e4a5850cf6042a32938d9f4ccef28836471dad9b","observation_id":"878f09c6-1f54-4edd-8bba-c0012929ce27","resolution":{"observed_at":"2026-05-17T16:25:15.000171Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":17,"verified_fuzzy":40},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 63 of 63 outbound references and 45 inbound Pith citation observations for arXiv:2406.18495."}