Pith. sign in

Paper Citation Record · LEDGER

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation

As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2605.28830.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.28830 v1

Coverage vector

measured 15 of 15 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-12T23:33:25.778345Z

measured 15 of 15 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

15 of 15 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved13
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c720f58f-b7b1-414e-8995-e339ae80ffc1 · outbound

This paper cites Guardbench: A large-scale benchmark for guardrail models.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Guardbench: A large-scale benchmark for guardrail models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:e0e74736b7f57f3008b775892dbc6ab38ddcdf3b0f851903d9537ae78dc54173

Observation 59261aa5-9e2a-4404-b092-5f5b177a8f8e · outbound

This paper cites Yihe Deng, Yu Yang, Junkai Zhang, Wei Wang, and Bo Li.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Yihe Deng, Yu Yang, Junkai Zhang, Wei Wang, and Bo Li

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:559a093d3b29ca7d0456aa6d474ba5a57ea6a44cbd15c233393efbd316d11daf

Observation 6007825f-8c2f-44cf-b8d0-c49ff9adf6fb · outbound

This paper cites 8 Figure 2: Model size does not predict safety detection performance.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation 8 Figure 2: Model size does not predict safety detection performance

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:42193ae3ec1e40163f1e56ca668fcf4814b10df7083e087843c5d0acc5028c24

Observation 63c79d65-3c52-414a-a158-c32329a27542 · outbound

This paper cites WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:6f553530fe4ef7ceb8a583e5e8b6ad5470c3d0fc3f311fbf4c097f824f08de80

Observation c252e8fb-3664-4d3c-b482-522861b47e7a · outbound

This paper cites Intel Corporation.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Intel Corporation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:89cffda404b8853cfc84936f43cb619609e8d21857ac9b624b35055e58e2bd8e

Observation 112aad25-1d34-479e-909f-efe042d2269c · outbound

This paper cites Jiaming Ji, Mickel Liu, Juntao Dai, Xuehai Pan, Chi Zhang, Ce Bian, Chi Zhang, Ruiyang Sun, Yizhou Wang, and Yaodong Yang.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Jiaming Ji, Mickel Liu, Juntao Dai, Xuehai Pan, Chi Zhang, Ce Bian, Chi Zhang, Ruiyang Sun, Yizhou Wang, and Yaodong Yang

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:e0fc6f2c17c0698ac355ad0e93538d4c1d5e9d1314744eb121e91cbcb4c1ef83

Observation d1bf5624-a0bb-46c6-9fb7-b2e7668a99c0 · outbound

This paper cites Cultureguard: Towards culturally-aware dataset and guard model for multilingual safety applications.arXiv preprint arXiv:2508.01710,.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Cultureguard: Towards culturally-aware dataset and guard model for multilingual safety applications.arXiv preprint arXiv:2508.01710,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:3bfe234df32d935baae97e623139b27ce2869d3f8ff4627ca5ac276897634f00

Observation e7a36fd7-91d7-48cc-950b-2db424c69864 · outbound

This paper cites SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:a7ba08628c2e7ebe189200e87215c08501f3e793bcfb2a919426cc25785629dd

Observation 380ff79a-21a3-4b5c-a2be-a0a70bbdd096 · outbound

This paper cites Holistic Evaluation of Language Models.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Holistic Evaluation of Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:bb3223f7e1d8bdc4bd4c2a1c316e03f1c6a59aa28b5cb04babfeccac45d3e108

Observation 2856ec7e-b59c-4cc9-b7f1-4832f2b43496 · outbound

This paper cites gpt-oss-120b & gpt-oss-20b Model Card.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation gpt-oss-120b & gpt-oss-20b Model Card

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:a131d72c433c307615138d878ab7a94cb12ff4cbfa6addfdf74466e9f3250a44

Observation d133d424-1d0a-4521-afc0-26dd46581487 · outbound

This paper cites Granite Guardian.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Granite Guardian

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:2480b74b8f03a4678bf8099ca85865a724b60c829b35c226d508d16dcebb23b8

Observation 9963d115-9995-473a-91aa-74023ac7cdcc · outbound

This paper cites Paloma Piot, Patricia Mart ´ın-Rodilla, and Javier Parapar.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Paloma Piot, Patricia Mart ´ın-Rodilla, and Javier Parapar

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:67f544926f665290996b8ae1fff37e8df9669fcfe41e90cb43eeca480dc1bd12

Observation d3608fc7-39f0-4f7b-a602-93a0c3eda9ef · outbound

This paper cites Alexandra Souly, Qingyuan Lu, Dillon Bowen, Tu Trinh, Elvis Hsieh, Sana Pandey, Pieter Abbeel, Justin Svegliato, Scott Emmons, Olivia Watkins, and Sam Toyer.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation Alexandra Souly, Qingyuan Lu, Dillon Bowen, Tu Trinh, Elvis Hsieh, Sana Pandey, Pieter Abbeel, Justin Svegliato, Scott Emmons, Olivia Watkins, and Sam Toyer

Reference 14

Resolution
verified exact
doi, observed 2026-07-12T23:39:08.692573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:8f04dd270ab9e98909b310a90ab96ae9f1ee6c2b5d47f8dc8693aae479c03740

Observation 2c26ebce-5e82-406e-aaa1-46c1469485b6 · outbound

This paper cites SafetyBench: Evaluating the Safety of Large Language Models.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation SafetyBench: Evaluating the Safety of Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:c07f600b6f9f718924c567813dabb5d3b1150fcf7b786be36689579fc4e4e90c

Observation dfa84aa0-5688-4249-84fc-0a0f6974ed2b · outbound

This paper cites User Safety.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation User Safety

Reference 16

Resolution
malformed identifier
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:fe9df3ec79aedec19560a8912e79fef89f68441815619b0d847a03d528d7c458

Pith citing papers

No inbound Pith citation observations are available.