Pith. sign in

Paper Citation Record · LEDGER

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

As of 23 July 2026, this Paper Citation Record lists 63 of 63 outbound references and 45 inbound Pith citation observations for arXiv:2406.18495.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.18495 v3

Coverage vector

measured 63 of 63 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-17T16:25:14.744887Z

measured 108 of 108 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-07-23T06:31:01.910684+00:00

measured 45 of 45 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-14T05:21:30.132993Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T06:15:00.866473Z

Reference resolution

63 of 63 outbound references displayed

  • verified exact17
  • verified fuzzy40
  • unresolved0
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch5

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a331e6aa-2851-4439-819b-9d90f00f4076 · outbound

This paper cites GPT-4 Technical Report.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs GPT-4 Technical Report

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.794770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:d66b051f793810f3ca36c1e4517740a654acb801d099766f92a9bdeb2b9e907e

Observation 25708366-4fa9-43e8-96fe-01986aa66005 · outbound

This paper cites Llama 3 model card.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Llama 3 model card

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.941524Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:8487a56b5620755c7548dd1bd11114f8acd360f32ea63d58644f6a83633b750a

Observation d872d819-978c-4829-b6fe-cbf6ba537626 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs The claude 3 model family: Opus, sonnet, haiku

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.997187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:06d790de2aeedacbdb88f2144837097d02bf6a40f7e9908fa39aa8bea79cf6e1

Observation 07a1da5b-b4f0-44e8-b987-1a99bf9035de · outbound

This paper cites Foundational Challenges in Assuring Alignment and Safety of Large Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Foundational Challenges in Assuring Alignment and Safety of Large Language Models

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T16:25:14.801617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:1b2fc2c8a99efea45355a46ae85f20a6f90b9ba4ad6cd65a0801780a9c8b7d31

Observation f00169e0-0116-4e04-a219-d8721967e6ba · outbound

This paper cites Training a helpful and harmless assistant with reinforcement learning from human feedback.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Training a helpful and harmless assistant with reinforcement learning from human feedback

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.003595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:2b1891c30597c817e19693aa68441434e35ac0975d95e3be3ab8a0641244ea85

Observation 167aa439-8561-44a3-b238-35fe66429d1d · outbound

This paper cites Longformer: The Long-Document Transformer.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Longformer: The Long-Document Transformer

Reference 6

Resolution
metadata mismatch
local_arxiv, observed 2026-05-17T16:25:14.811728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:4f6f8fc526ef6bc0f65440a7517170c6b9da3fb965888ec95b10430c45c86385

Observation 6e6e61f8-16bf-43d6-bf13-78e229ebf1ac · outbound

This paper cites Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.819912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:bb92cbefd69ab523187d43a22d024f9f0417ffd51243fd8ff7fb7cfcbb68faf6

Observation f95ec4dc-0b2c-44fc-ad56-92978e0a93ee · outbound

This paper cites Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, and Ludwig Schmidt.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, and Ludwig Schmidt

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.012511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:d65b679e9b8cf06f0f7f86225d291093ec7e26f3764db28d596fae935124a674

Observation e877ed7f-a5d9-4da8-aba0-e684b1d70f20 · outbound

This paper cites Safe RLHF: Safe Reinforcement Learning from Human Feedback.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Safe RLHF: Safe Reinforcement Learning from Human Feedback

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.826599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:3fb30bed9b05805d6fac3352a19b8524875ba384b95cbe08ab925d8b895bf5bb

Observation 79fc2aab-b7be-4f85-bcf3-e3a4d415dcf5 · outbound

This paper cites The measurement of interrater agreement.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs The measurement of interrater agreement

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.018502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:4769e7abdcb5da51eb2ebdaf2994b4e6186fc7a20d6a3191e4c5878938ad21a3

Observation dfaf4668-8bf9-4822-ba09-f582d5242f96 · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.832759Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:93187d42cc42ddb543f5656344c79a07d2e0fc02ac3a3871d78e2ad68ae8698d

Observation ff95bfa7-c8e3-4239-a9cf-30004be2e4c6 · outbound

This paper cites Realtox- icityprompts: Evaluating neural toxic degeneration in language models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Realtox- icityprompts: Evaluating neural toxic degeneration in language models

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.024027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:d1c13c7f873113fe93e543398cde7c09aabfacd9631595dee5089e42db05268a

Observation a6f947b2-4071-4765-94e4-06c4f286006f · outbound

This paper cites AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.838539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:62d4d9f89ebbacfa6d5771eed93275309fcb40df0ac94dfec42df592ad220539

Observation 977d9e24-0485-4c73-821a-479f1350a22c · outbound

This paper cites Ruddit: Norms of offensiveness for english reddit comments.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Ruddit: Norms of offensiveness for english reddit comments

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.029413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:f5155d77cda750f10d80cafa16aec63a9fd9ae530e9e78fb8585090119734ed2

Observation 2ec2ec9d-f009-48aa-b07e-d632e06d2172 · outbound

This paper cites An Overview of Catastrophic AI Risks.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs An Overview of Catastrophic AI Risks

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-25T05:03:47.506388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:22b33fd6427da095601b25d39ef0f2b1fa3041a5a70fbe672545ddae4049e4e4

Observation 72db41cc-e8d5-43e0-9cc8-5b8bcb80f5e0 · outbound

This paper cites Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.849301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:3333084c51cf04b9305dcdfe5b041c0c13444bfd883130db3e9d5cc34114558d

Observation 23daa911-e05d-4c4f-984d-71eb7289922e · outbound

This paper cites Smith, Iz Beltagy, and Hannaneh Hajishirzi.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Smith, Iz Beltagy, and Hannaneh Hajishirzi

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.038222Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:157c5c620aaf672bf6c8f4ed425fbda0d2454948a21a84fb2d82a24167919c3e

Observation 9c4b6b5a-df39-439b-a808-9646388d6191 · outbound

This paper cites Beavertails: Towards improved safety alignment of llm via a human-preference dataset.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Beavertails: Towards improved safety alignment of llm via a human-preference dataset

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.041703Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:759f0e6c8314a5454cb4a2ef562e778ebd4fd0b28f0a1d697ed4d38be0662dd9

Observation a426fb12-99e2-4cb2-8c5d-2953105d1293 · outbound

This paper cites an unresolved cited work.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Unresolved cited work

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.045416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:f9051ac10b9ac10eab856beb2811853d9db89a657a1418b7f64ba575b1aad7bf

Observation 3ab805f5-3864-4c30-9366-e43732a29c5a · outbound

This paper cites WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.855330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:9a22a2c57d147eaa96e0df5964e4e43d7388576e62c155e729ff190dc10634d0

Observation 2c9d52a0-e208-4458-bc21-f7cf34f28937 · outbound

This paper cites A new generation of perspective api: Efficient multilingual character-level trans- formers.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs A new generation of perspective api: Efficient multilingual character-level trans- formers

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.051572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:4d2d7a1010e5f37c814fd160e9a79093357a0432f3306b2bb0a582dd6d5a5a84

Observation 0f840343-e05c-4f98-b0ef-1094684dc243 · outbound

This paper cites SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.860999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:9f67db19af6d5ae00251e286bfbe7f2dc3f846bbbb25c0d2dbee0a2039057266

Observation 4ae480b6-9c61-470c-a90d-6399246e790d · outbound

This paper cites ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.866587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:5e2e2122c0e388cbda46347d94d6c30d915b938ebf64e15efc5079a0aa8d4e57

Observation 0f3d717f-0b7a-4062-97c9-c082bb06011d · outbound

This paper cites A holistic approach to undesired content detection in the real world.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs A holistic approach to undesired content detection in the real world

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.931058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:747227aedc7fb6654c0ed4dfa8ec65f60fd3b8149c40eb817599a54030c05fbd

Observation ec39ab30-010f-4947-a3c2-01a92ceac38e · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.871506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:0d13dc2b70bfc6df1af3a9bf2c87aec076f9b053625a947d9489b4869630150a

Observation 2763d7aa-27f6-4a31-bef5-7ff2635145be · outbound

This paper cites Meta llama guard 2: Model cards and prompt formats.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Meta llama guard 2: Model cards and prompt formats

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.938266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:2fd5c41a40bb645bd11047fd93161daad4b16619723a2932b29c8be843ce02dc

Observation 8e2fb651-e175-4bc0-aa69-5e71125b37b3 · outbound

This paper cites Chenghaomou/text-dedup: Reference snapshot, September 2023.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Chenghaomou/text-dedup: Reference snapshot, September 2023

Reference 27

Resolution
verified exact
doi, observed 2026-05-17T16:25:14.787804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:56e4c19b3e882387d3b70165bfece7818c39e58e0a012f243cfd5e66198505a7

Observation ffb72553-54ff-4228-bac8-3028f477a6b2 · outbound

This paper cites Openai moderation api.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Openai moderation api

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.944696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:8c1c364a1b7beecd55e9c9e68e07fb2417bfd7b071a71c61eb033316b249d49a

Observation 90f0eb21-5407-40b9-92ec-2261ac57a641 · outbound

This paper cites SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.876735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:4119124c2582606cb60d430ca13c9ae2d6af63716646b1c867e13e115bc9d845

Observation 00e99c7d-61c7-475f-b471-5822ce9fa71f · outbound

This paper cites XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.882872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:6449b19bcc0f58179375467ea9d548e1220e1042be3fc18b6ffe8e857f5bc4d5

Observation 3ec50fd2-280b-4c61-8255-dc92afc44ef1 · outbound

This paper cites Safety Assessment of Chinese Large Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Safety Assessment of Chinese Large Language Models

Reference 31

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T16:25:14.891841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:4fe97f1b50421a627daca08cb7b6f20f40b5c8bcd71ce33822d873191a4b6c59

Observation 10652d37-b599-46f3-819b-5ee9cd9847f8 · outbound

This paper cites an unresolved cited work.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Unresolved cited work

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.957540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:dc79a0d0c330ba4f99fe5df4c2a956137daa6fe9b5142ced768d33ec646f6026

Observation 7c4c8529-f4d9-4f04-92f0-30d1272e1bc7 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.961214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:43947705d657f23fa0746a60aad92aeae5d8e7c7a74a367acb0fe3a1e69c6537

Observation 6d4c4929-b179-4f63-8bb9-a2c6c108bf7e · outbound

This paper cites ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming

Reference 34

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T16:25:14.898535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:152d60f7771a8947bfea2c42ca5d8c0ba75746a8289608794aa34829898a9619

Observation 3090015e-366a-49b9-b1e8-71a6128993d6 · outbound

This paper cites Llama 2: Open foundation and fine-tuned chat models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Llama 2: Open foundation and fine-tuned chat models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.967679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:126490dae2d27d8ffd6d33945a7581a38d7ffe0a6fc7294011bd5067472d579d

Observation 4f5f243a-d99e-431f-9ae2-b485bdeb8495 · outbound

This paper cites SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models

Reference 36

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T16:25:14.904441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:db61918a7240eee0f04098f62498df114c6ad801eb1b04dd96325b3a12da9715

Observation c95dd37a-65d2-4051-8125-61a75faa3f98 · outbound

This paper cites Introducing v0.5 of the AI Safety Benchmark from MLCommons.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Introducing v0.5 of the AI Safety Benchmark from MLCommons

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.910778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:159bfe53195834d2d245d272076d04318bddbf289f1a666785b83e1267f6e1da

Observation 17ade557-0482-4cf2-ac20-62bb6333c0e0 · outbound

This paper cites Do-not-answer: A dataset for evaluating safeguards in llms.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Do-not-answer: A dataset for evaluating safeguards in llms

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.977026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:2e8fb869051d28a77e698b81797a10abb4faf94511a2453843b8f1bfdd986a55

Observation 5a766751-fc22-4886-b1ca-c12b7d1b5dbe · outbound

This paper cites Ethical and social risks of harm from Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Ethical and social risks of harm from Language Models

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.916284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:4016d081dd070300cb5d4e50e77fa365490898642c9425ff0d05be5728d54839

Observation 7df29d8a-16a1-4808-9cec-10210980b32d · outbound

This paper cites Semeval-2019 task 6: Identifying and categorizing offensive language in social media (offenseval).

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Semeval-2019 task 6: Identifying and categorizing offensive language in social media (offenseval)

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.983928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:5fb075d6c2ea3211be0bf3df524ec58d5adddfaec68d176a1e3824ff6bb89c03

Observation ef6c1793-6a50-4ffe-9a18-c2cadea13613 · outbound

This paper cites Wildchat: 1m chatgpt interaction logs in the wild.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Wildchat: 1m chatgpt interaction logs in the wild

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.987260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:988109305c021316638b72143ed93d6b089736e418a540baec74e7d9040bbcf8

Observation d093f015-3bf6-4ab7-947f-abaab3128c82 · outbound

This paper cites P Xing, Joseph E.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs P Xing, Joseph E

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.990162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:dc2873f2d65ab147af5d7382002cd5721bf689b219b61a6f0f9b7a99de972d59

Observation 10e3fb7d-8348-42b4-aa94-8bc3a8fa6194 · outbound

This paper cites Judging llm-as-a-judge with mt-bench and chatbot arena.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Judging llm-as-a-judge with mt-bench and chatbot arena

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.993697Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:146e4324fd99829e53149770c731071546def10b39a079cdb554c26265e2f89e

Observation 78e3adc0-7411-4d4b-96d4-4c86ceeeba18 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:25:14.923012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:30bfc63b420dca1db95b39d7df8fcc577c81a8108fdde4385dc1da0521184a46

Observation e2f01e02-8ced-4cb0-9e6a-2ec177ccb688 · outbound

This paper cites Request.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Request

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.006141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:34dbf00f51c02fd17599dac8be3c68d5fb3426b4dad2a827de636b519ec123fa

Observation 65cb4354-6cc8-4bd2-b9cc-70ebf1eda3db · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.009227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:78aa9226931c76832c02e6fd35e448ee4a00934155fda502a1d4960321b875b7

Observation 9aba8f34-f3f0-46ed-86b9-834bf9cfcb23 · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.015262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:de91ba902e83af615e1756d5758939971ba04506928fd231f32ceb717ec99e50

Observation b1904c56-0eef-4458-9a7c-6d062f2d789e · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.021187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:29bf2951901f72fee5a0d8c50476e27a973458dfa2859b10e382a14c49957a44

Observation 1e0f9a9a-ef06-4b6a-a57e-7843932117aa · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.026686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:bd73eee8239046469c4609fc418a2e78948ca832d96742db3e444f7c9673f4ff

Observation a9a5ad45-6336-48c8-bfb9-9ea6b2735fcf · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.032130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:fd6d5e5a1519b6adcd5e1ad28362d5e5bb8fd7b76dd7ac23e7266e4775cd608a

Observation e00e7850-a015-49d3-8d96-71f8cf43af09 · outbound

This paper cites Human" for the human response, and key.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Human" for the human response, and key

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.034827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:403edaa35ab52532575f30ae883ded63e7056618638e6e8a24a95a8c1ca0d1b2

Observation 8d0d9d3d-b4bc-4772-82ee-cce4fc887e31 · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.048495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:aa0a8e37fedb3fa3ddcd1d48a4c9e46b6d19c13e2376171193b87abd213d4f61

Observation 9344b7f3-8f45-4490-b473-105aff195f39 · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:15.054789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:59e2803554ea681adbc35a6bb40f207ef4085df63fc4cd8b7bdcdfcc697807c6

Observation b7bc28d3-3f3b-4c1b-9af9-f8626a35b238 · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.926927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:d9b97275e3441e6f5df66bfd94bdc885c7885b65469a42d771e585851b328faf

Observation fed3b2a0-8f3e-4bf9-9f27-f5456269f7e0 · outbound

This paper cites examples.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs examples

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.934699Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:109d845cbc5d0db98d07f1a127bf697a6403cbb8c43a7000293095a4ff1d034d

Observation 49056f99-63b9-403e-978c-cd1953575d99 · outbound

This paper cites examples.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs examples

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.948025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:9ea3b08386fd65b428e36b7df92bbf588c77ae7af5aa9544e11d5317d7199977

Observation 1b91cf77-0732-4c56-8097-cd778d797921 · outbound

This paper cites Assistant.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Assistant

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.951161Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:181f07f3fa5dfa48271204212be504ff87607541814c39a55da2ed282a4707f9

Observation eeb36b6e-1a01-4a5f-9fc6-6d8a05725009 · outbound

This paper cites an unresolved cited work.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Unresolved cited work

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.954285Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:af7283124afc35718833c059d7a2ae779ca83373367172f575bd5e577d943bd9

Observation 4f045e81-56a9-4fd7-a01d-df436f867b8c · outbound

This paper cites an unresolved cited work.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Unresolved cited work

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.964337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:aecc7607735e142e4c1d280221959d62e46c9c26dcf1ebba0ce119e333908372

Observation 93ed501b-c30d-4845-b2f5-677fa58deee7 · outbound

This paper cites Needs Caution.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Needs Caution

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.970738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:076f721f8a496f9550ce7d297c06ec0f6a495647739834277ea2b51010ca1d95

Observation 21377d56-d16f-4cca-94b5-e3a109ecf8ae · outbound

This paper cites an unresolved cited work.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Unresolved cited work

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.973687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:7642cd0dfd51a3b7e194391226c366ec0f337a5b3707522572ccef59ef8e05a4

Observation 64a0daf6-40a9-49cc-994a-77e715d78efd · outbound

This paper cites an unresolved cited work.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Unresolved cited work

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T16:25:14.980351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:53bc0dd66ad7b8d4a39130d7ce3981eb99845af98a25d0736f16a267df1d7ae2

Observation 878f09c6-1f54-4edd-8bba-c0012929ce27 · outbound

This paper cites As an AI language model, I cannot.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs As an AI language model, I cannot

Reference 63

Resolution
malformed identifier
raw_fallback, observed 2026-05-17T16:25:15.000171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:f16a13002f7dc1a39672f808e4a5850cf6042a32938d9f4ccef28836471dad9b

Pith citing papers

Observation b9b2cbac-3fe4-417f-badf-33106ac3a2bd · inbound

ShieldGemma: Generative AI Content Moderation Based on Gemma cites this paper.

ShieldGemma: Generative AI Content Moderation Based on Gemma WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-20T13:17:39.496950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-20T13:17:39.444002Z digest=sha256:bd2121c278b454b17574ff8d9a59f4223645f3b313cc46e20e180d4103ce0e71

Observation 5ac70946-520d-4327-99c8-769fdabb0ffb · inbound

Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs cites this paper.

Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T16:18:01.560780Z digest=sha256:db12fe02e983af3dfd72b3e500c64dc42892e49d57a0f45ad7dd0bf3ecfaf507

Observation f7ff959f-544e-46e4-85dd-884ef1060c9b · inbound

Peering Behind the Shield: Guardrail Identification in Large Language Models cites this paper.

Peering Behind the Shield: Guardrail Identification in Large Language Models WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-23T03:45:21.400762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-23T03:45:14.234545Z digest=sha256:2848b248e7c55c3814a51369b82ceac7e531372b01a5ec907d10c05680b4d00e

Observation c078129b-204c-43d6-86db-6731ea5b733f · inbound

Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment cites this paper.

Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-19T11:53:03.552944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-19T11:52:36.688263Z digest=sha256:146abad71f30f3190ce58184cddf0e0b0d3b91a59f43e72c82572c90a4fdfecd

Observation 1e1842fe-dfa8-4f9e-8677-0b6e6b4112da · inbound

BarrierSteer: LLM Safety via Learning Barrier Steering cites this paper.

BarrierSteer: LLM Safety via Learning Barrier Steering WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 10

Resolution
metadata mismatch
local_arxiv, observed 2026-05-25T07:05:26.753510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-25T07:02:03.058731Z digest=sha256:68a79e69ab044657da9a46accd13107356bffc737aeb84af1d166d999b9fb369

Observation fef350b6-8a75-4a80-86c0-8e20a620f559 · inbound

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules cites this paper.

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-13T19:24:54.381722Z digest=sha256:1904b154bae7fd85111ad3eb466070f5fab0df19677df44aecf6b3996d3a4483

Observation 5f64a7ef-0590-41fc-851d-ad40af7bc9dc · inbound

Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs cites this paper.

Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T17:27:13.339411Z digest=sha256:46eaf87f969c5404ad3693a4fe8e7b8a01936663cafc05f2d1880ab5f8c5ad10

Observation 90064aa9-e27c-4ae5-8893-16ab3d6d027c · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-10T18:25:53.037936Z digest=sha256:c670e668df5d8bd224c448d9d00e502673c0ab4b5e265a30d3fb86267903233c

Observation d053ce7b-03aa-4f0a-9ce8-3fa3f2aa411e · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-13T00:19:33.861692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-13T00:19:33.861692Z digest=sha256:2a1f8226392035ac3cb348bbd533de377d1e6a53d6c735af14d57708320f2f62

Observation 33dd3198-1d44-4e19-980c-8d1322a4e63a · inbound

Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies cites this paper.

Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T17:55:46.600687Z digest=sha256:28217026bfec812eea64ba726796c5700d88b8fb29cff6478006c9e40dd5a2c6

Observation a7e76d4f-867b-4dff-8756-6912b13c9654 · inbound

ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems cites this paper.

ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T16:27:18.594869Z digest=sha256:c21a8432127622f7c3598d5aec4190eba0b9da711e501c6e56329b9bbb0c2c80

Observation f7ca3975-ea2a-495b-ac2d-0bb702c3d5f1 · inbound

The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious cites this paper.

The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-10T13:09:59.573758Z digest=sha256:1c3b11f2dcff5d1b884ee5a01fb9b445785b9672100eb39106931f32570ea505

Observation b5a7804c-8973-4454-8e28-d576a25b6a11 · inbound

Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives cites this paper.

Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T06:55:24.385051Z digest=sha256:936d85905742113822001454db1555a0451aecc82e2e078f1f40ee4df91884e9

Observation fae64d48-2412-475e-bd67-dae325f422c9 · inbound

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts cites this paper.

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-10T05:52:28.822723Z digest=sha256:0b431c2c99f02f4d10b175c1ab3ec559bc64c391e90e5d5af791ef4d3e9a3715

Observation af06ce84-aa00-4fa1-bdb0-d63225cd369a · inbound

STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming cites this paper.

STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-10T03:06:21.624159Z digest=sha256:cdce53b03b05b1b7552c73f4ef5d3786dedb2cffd95193999d565f7d145b4be4

Observation a4900594-7bda-4347-b54a-777e9ee387b2 · inbound

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework cites this paper.

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 84

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-09T19:45:36.021741Z digest=sha256:e30b34a1980684f75eaebd01890e20312810a96960135f91f18edec04c4e9414

Observation 838155ab-a03c-46e2-8236-3ff8eea07cda · inbound

Self-Mined Hardness for Safety Fine-Tuning cites this paper.

Self-Mined Hardness for Safety Fine-Tuning WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 7

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-08T18:23:49.808496Z digest=sha256:898fa573d2b017ab10b4a107e6d0fba5427938bda2b69e9d55f7d41ec271e87d

Observation 3147ba89-70c5-42c2-ad12-3102ab92cd86 · inbound

Self-Mined Hardness for Safety Fine-Tuning cites this paper.

Self-Mined Hardness for Safety Fine-Tuning WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 4

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T00:55:12.250651Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T23:56:36.068713Z digest=sha256:87f58f2cdf2c9873065aa69634cf5eec738470e1e879f5f763daab3f7e654c72

Observation 4fa2c9bf-fb4e-48f5-8141-764aaa31cca8 · inbound

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy cites this paper.

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-08T16:49:28.684979Z digest=sha256:b3b4e70abca94357bff4d17c39c698516e6421094487186e977fb0763d6a2daa

Observation 2b36bcf9-1cb8-4617-9531-ee4770bc2752 · inbound

GLiGuard: Schema-Conditioned Classification for LLM Safeguard cites this paper.

GLiGuard: Schema-Conditioned Classification for LLM Safeguard WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-11T03:19:11.495230Z digest=sha256:e49dfca8a831b709be5f456de0e2d7a99411a291eade3395e170e8baeac90b97

Observation 46b30a19-b46b-4e6a-8f68-58a9746808ce · inbound

Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data cites this paper.

Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-13T01:48:46.380615Z digest=sha256:adad65437899c74b992b27e732203f4e92669c508492cd78a37e3bdc208062a6

Observation 342ebf4f-b167-4762-85ff-a5d1164f3824 · inbound

Bayesian Model Merging cites this paper.

Bayesian Model Merging WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 58

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-14T20:40:47.471970Z digest=sha256:e5003b21a97ae59d8bdd73cb50033a5c4b61ae1ef4952412239eda9bc64e211c

Observation 363a5dc2-faac-4a06-95a5-7f16f798f2d0 · inbound

Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis cites this paper.

Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:15.056079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-14T19:10:29.055784Z digest=sha256:4ec7085790b2efb6f22f036b66697f22397fcd7d063d4199dfe3feed558f26b9

Observation 70017aed-3fc4-4d7e-9574-902e1121a368 · inbound

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails cites this paper.

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-19T23:43:17.756873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-19T23:42:58.135553Z digest=sha256:b1fc4007dc4450b66a4a00eefca0805b3ae955c2856174ac39918c3e87cc83ed

Observation c7e1a42f-efed-4a59-95b5-94d2cb1247a0 · inbound

Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics cites this paper.

Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:03:13.902127Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-20T10:54:20.285841Z digest=sha256:b09f1ebf521c49f81595ed7c1f77a653063547bce020cca358d89fde6071cef9

Observation 0145f2ca-6abe-4c53-8273-9be1ea18f396 · inbound

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025) cites this paper.

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025) WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-05-21T07:39:48.497203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-21T07:38:43.363709Z digest=sha256:d7f1ce5456ab2ef490fb8f1d9c3c3e2e54b4427bfafafae1ddf821a7ce9d509f

Observation 9324d343-6067-4d1e-9dc2-9980417d560c · inbound

AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue cites this paper.

AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-06-30T21:35:04.723120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T21:28:25.577739Z digest=sha256:bb7c896d9162465913521023a9e3a9a7178af285718727633e846d8580966b81

Observation 8b3ac29c-b960-4245-90aa-9d04b50c75a5 · inbound

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection cites this paper.

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-01T16:35:50.600485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T00:29:50.433221Z digest=sha256:f3d0099114f9feea59704c57b5dce45079afaf436ba3f3568f7d49b8094ce3b7

Observation 63c79d65-3c52-414a-a158-c32329a27542 · inbound

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation cites this paper.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:79e0f07396ccc1d2937392808a468e21ae0c6b0e54667ab72103c9e001348ec6

Observation f2636ba3-ff4c-4d7d-92c3-6fd7a591f264 · inbound

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content cites this paper.

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-06-29T09:13:16.016927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-29T09:11:58.843585Z digest=sha256:9ca931a3be76b0997fd281fd6d397990879f59af53ffaf1fa38135b43ff173cd

Observation b5511fb2-f112-4eb1-b316-e69c7ecfcd4e · inbound

Gate AI: LLM Security Benchmark Evaluation Methodology and Results cites this paper.

Gate AI: LLM Security Benchmark Evaluation Methodology and Results WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-07-01T22:46:19.185026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-28T15:05:08.411286Z digest=sha256:837a4cf5232dafaabd661a9b1849a524c0d598a201a4aa7d161113d66a9edb81

Observation b955e541-c739-4445-986c-5af19cf2ae5c · inbound

Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers cites this paper.

Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 12

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T09:47:59.639874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-06-27T10:19:49.060228Z digest=sha256:5144f036ed743423011d4bc99afb00bbc1624fa0a7b9b7801e2869cfd19bd6d0

Observation 389737a1-8a89-4d75-8470-71c2176a8d47 · inbound

Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers cites this paper.

Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 12

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T07:55:30.519757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-07-01T07:54:38.523190Z digest=sha256:a0fcca552e9e6a16bdac31df95c56969a552991fe77a4ee25fbfefa76247e905

Observation 5e086606-93da-4a17-88d3-f3aead05ecda · inbound

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation cites this paper.

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 155

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T20:48:56.463623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-06-27T01:07:49.603969Z digest=sha256:931269c4c7f41e4676cd1bdf9ac2c89e66dc7d5a16d16ebdbfd8a20df7849bfc

Observation 9ed39ab4-125f-49fb-8297-fcd1b77fa33e · inbound

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming cites this paper.

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-07-04T04:09:34.766057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-26T17:11:40.088809Z digest=sha256:ffdece95274d3d8dca891ecde78f0fcd9de1a5329f4071edf005e8d11ecaa984

Observation 2d3f59e9-38b7-4943-9475-8c00d7400c23 · inbound

What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations? cites this paper.

What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations? WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T03:39:31.064546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-26T17:43:17.000740Z digest=sha256:b3ee865ffda11b1921c954e613c18c39604734ee91234fb762091dbabbad271c

Observation 5edbb1a7-087c-4376-99c8-5b0a8d6c3b0a · inbound

Efficient Safety Benchmarking via Item Response Theory cites this paper.

Efficient Safety Benchmarking via Item Response Theory WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T15:55:48.983903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-07-01T15:51:00.484343Z digest=sha256:a995f7107d19a4ebfae612f2ba55fa973d350207f66146e29b7798cb6c99eb29

Observation 2fb5785a-726f-4627-a9b7-b630cc353306 · inbound

Discriminatory Compliance: How LLMs Answer Queries from Protected Groups cites this paper.

Discriminatory Compliance: How LLMs Answer Queries from Protected Groups WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 105

Resolution
metadata mismatch
local_arxiv, observed 2026-06-26T12:59:29.384777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-06-26T12:58:09.227648Z digest=sha256:0ab763f2f2ebbe1b6adaa71076df529de4016fb976adafe887697e6ce08cb6be

Observation 7f489fbb-cfb8-4d29-bcb3-7954ac15773f · inbound

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety cites this paper.

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-04T16:59:58.608983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-26T00:03:27.948225Z digest=sha256:f1898a85db02cde371dd2978e0ffa4426e9cd722f0534e68dfe72be2d1198a02

Observation 07667cd3-ac62-4caf-8395-b15867cd85d0 · inbound

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety cites this paper.

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:03:48.820968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-29T05:16:19.502837Z digest=sha256:44a06435473bf07a5cd4c441ffca07582f0f02c884b1a887539c51e06b5ea520

Observation 48ec0eb3-4e0b-44a7-b56f-c20f65a95c89 · inbound

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions cites this paper.

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-06-25T21:18:24.045558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-25T21:11:37.666975Z digest=sha256:57907c5f214d76c25d102efd1a439d7cced59fc7308e2407c0dc177e50d9c5ec

Observation 3218c63f-1684-4e82-bbd2-ab1414dd18fb · inbound

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring cites this paper.

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-04T20:00:07.911016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-25T20:56:18.687903Z digest=sha256:872c619803f6b01c0b9ed2fd2dd143cc7ec3e46592588fb73c706d532d95584e

Observation e1539bfc-f4fc-4e8a-bf63-7eb4381e87d0 · inbound

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring cites this paper.

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:09:51.041176Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-26T05:27:21.279142Z digest=sha256:3f11f5416805575f4130f77acf94e6b6e8262d48f52ca17b24247b4a904780d9

Observation 77399629-29a7-41ed-b080-477d92753fab · inbound

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety cites this paper.

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T14:48:32.681628Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-07-03T14:38:55.045628Z digest=sha256:86d8523824f67b89b495df83a79bd344b304c0b2f302d69c06ac628dd0fba52f

Observation 98e0a8fc-8db3-4ed7-b23d-4e9e6490c449 · inbound

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models cites this paper.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:dc6cfb346f3abb06aff69f1a50d77bfe931679c0963a1b05c00e896e4b09a922