Pith. sign in

Paper Citation Record · LEDGER

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

As of 13 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 3 inbound Pith citation observations for arXiv:2511.10287.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2511.10287 v4

Coverage vector

measured 78 of 78 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-17T22:29:36.960961Z

measured 81 of 81 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-02T02:44:16.755987Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-02T17:27:14.956941Z

Reference resolution

78 of 78 outbound references displayed

  • verified exact23
  • verified fuzzy52
  • unresolved2
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 545088ee-9011-4783-861f-f3209b9fe15d · outbound

This paper cites an unresolved cited work.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-05-17T22:30:23.615677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:b011a947d076fc906fd68ac43ca30aed7066b692f6201e90a37a6dd8fb18ebf4

Observation 67d161cc-e878-4da4-9875-e3a76ccbb242 · outbound

This paper cites Meet claude, your thinking partner.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Meet claude, your thinking partner

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.602024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:4d766013743372afb10cb9305ded57e9af699e964844dd3f6adb66a4db7b7175

Observation c2fc2b58-d671-4fe2-803e-fe973b1bb454 · outbound

This paper cites Doubao 1.5 pro: Api pricing & how to use doubao- 1.5-pro api.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Doubao 1.5 pro: Api pricing & how to use doubao- 1.5-pro api

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.599684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:c88857f8224d50c448333c33224cced681d8588e84371599ac630daa87878015

Observation 9350da11-2342-47f5-9208-873b5e72b1bb · outbound

This paper cites Qwen Technical Report.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Qwen Technical Report

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.283600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:83ad313d7892d161cb8ca81c1421751f03da4e11f08d551cf1b7d8462cd639ee

Observation 322959a1-b5ac-4d13-8dfe-9c690e9dc102 · outbound

This paper cites Introducing pcl-baidu wenxin (ernie 3.0 ti- tan), the world’s first knowledge enhanced multi-hundred- billion model.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Introducing pcl-baidu wenxin (ernie 3.0 ti- tan), the world’s first knowledge enhanced multi-hundred- billion model

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.604392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:9e7d2b7849b1ad79041f92f2221b05ed323979e010edf109a010bb389d3aaa2b

Observation 5b50bdfe-b856-43ad-aace-7504aa9a4dfe · outbound

This paper cites A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.280520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:1e664efcc1a01201425622d80263624538afda2d260421f1f58f7d8075d7967c

Observation dfc5f065-f81d-4bf2-9fa5-81d648d9e70a · outbound

This paper cites Murder without redress-the need for new legal solutions in the age of character-ai (cai).Avail- able at SSRN 5107942.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Murder without redress-the need for new legal solutions in the age of character-ai (cai).Avail- able at SSRN 5107942

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.606593Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:27378dcef2aa199040c725ded00cca64a914cca5c742e32c6380b438f91de620

Observation 70597037-a1a0-4065-a1d0-cce541816cd3 · outbound

This paper cites Suppression of acoustic noise in speech us- ing spectral subtraction.IEEE Transactions on acoustics, speech, and signal processing, 27(2):113–120.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Suppression of acoustic noise in speech us- ing spectral subtraction.IEEE Transactions on acoustics, speech, and signal processing, 27(2):113–120

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.597225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:797c5ffeb0afbd8cd862616e0e3937ef785f909b9e9dc87b1385e7f34f8b5f2c

Observation ad478650-8f62-447d-bfe0-dae4e48f6501 · outbound

This paper cites ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.286668Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:317196b466b08a5e4efddbb8e548ac8380d26fc75664f1a520c3bb7ac0609f88

Observation 427ab5e3-e48b-49de-9828-4484fa4d2808 · outbound

This paper cites Icdar 2019 robust reading challenge on scanned receipts ocr and information extraction.Web link: https://rrc.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Icdar 2019 robust reading challenge on scanned receipts ocr and information extraction.Web link: https://rrc

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.618263Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:80a6ddc1de39c82bccd780a1c9921b0f5197bef8e54eb0917fee28c89c3e1233

Observation 120d8ccb-a6e9-43a6-b27c-786c1fa9b044 · outbound

This paper cites Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.277475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:7df49e3953f0a99322a986d0c2fef95aaa111ea82453586748dc7ac14a7b4e3b

Observation 0d00c9ef-8190-41a5-b2c9-9a45c9c529d4 · outbound

This paper cites Hatemm: A multi- modal dataset for hate video classification.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Hatemm: A multi- modal dataset for hate video classification

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.611261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:0dc68a9179651ff9f269b984c5a7f667d569a180d2b8a0a7a6c32ebccca33e07

Observation 9b022462-54a5-437b-94ad-c07833bb2f7f · outbound

This paper cites The pascal visual object classes (voc) challenge.International journal of computer vision, 88:303–338.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models The pascal visual object classes (voc) challenge.International journal of computer vision, 88:303–338

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.613678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:97312e5bd5a10c47050d196cdacbdeb1f6ae7c4a0880efaeccc2cf7caa698272

Observation 053fec9f-3bea-4633-9b5e-dfa6fc320e8b · outbound

This paper cites guided mllm reasoning: Enhancing mllm with knowledge and visual notes for visual question answering.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models guided mllm reasoning: Enhancing mllm with knowledge and visual notes for visual question answering

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.609022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:7c2c5f3b5590dab19a065fcf24954991c07d74e5ca673f96fec2465fa75dad0b

Observation af544a11-ca92-4b35-afd6-4d48996ca1d5 · outbound

This paper cites Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.211554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:b4827a243eb9818fcedd5bac0046983e092bcccd660b71a72c64e76b90e97bbc

Observation 0ca0d029-9808-42bd-8993-93559f010943 · outbound

This paper cites Find any sound you like.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Find any sound you like

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.493611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:d7bcf1bfdfdd518bef247d115821194af3419fe8574b485802eb6ce1e79678e2

Observation 05a88bb0-9530-4eb5-a1c1-3a09a9defdbe · outbound

This paper cites an unresolved cited work.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Unresolved cited work

Reference 17

Resolution
parse uncertain
raw_fallback, observed 2026-05-17T22:30:23.525133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:c0032475033f214c56e58ace71705c377133da9a0b5147298a881a3652e668a5

Observation 44ecccc0-0f8c-488c-8687-1fef96871477 · outbound

This paper cites Gemini: Our most intelligent ai models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Gemini: Our most intelligent ai models

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.527165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:2ec0c4f5c16be0d1f02faa7f5ba678bfb1eca5b605cad5d9912a3743def9028a

Observation 52909e12-401b-468a-a600-2ca20dd23176 · outbound

This paper cites Mllmguard: A multi-dimensional safety evalua- tion suite for multimodal large language models.Advances in Neural Information Processing Systems, 37:7256–7295.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Mllmguard: A multi-dimensional safety evalua- tion suite for multimodal large language models.Advances in Neural Information Processing Systems, 37:7256–7295

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.591955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:49dedd0403f5b17fc96b9f9484026863302c49eed4f83e2a1d420e47562ab47c

Observation b1c77cfb-29a2-410c-9b66-b875850e17d2 · outbound

This paper cites A large-scale comprehensive dataset and copy-overlap aware evaluation protocol for segment-level video copy detection.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models A large-scale comprehensive dataset and copy-overlap aware evaluation protocol for segment-level video copy detection

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.511673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:fc38f962fa3daabc02d1dafd91940d442f5bab5c2ab34444879897d03f6a17dd

Observation b39721ac-9924-46db-b516-08cc611bf8d9 · outbound

This paper cites Deepfake detection using deep learning meth- ods: A systematic and comprehensive review.Wiley Interdis- ciplinary Reviews: Data Mining and Knowledge Discovery, 14(2):e1520.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Deepfake detection using deep learning meth- ods: A systematic and comprehensive review.Wiley Interdis- ciplinary Reviews: Data Mining and Knowledge Discovery, 14(2):e1520

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.556321Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:7a1319fab81f7ca98df53e69e11284748070a71c3bcf4dd4566e452775b42a9c

Observation 6211f762-6bbb-4761-ba08-4cbf70b0d8dd · outbound

This paper cites Gpt-4o: The cutting-edge advancement in multimodal llm.Authorea Preprints.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Gpt-4o: The cutting-edge advancement in multimodal llm.Authorea Preprints

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.531686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:735eaa1111922fbf03695836f04cd29d18b35d0bdb63f839343cc07ea4e97ff7

Observation 739972c1-18f7-4de9-925d-a0f891d4380f · outbound

This paper cites Funsd: A dataset for form understanding in noisy scanned documents.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Funsd: A dataset for form understanding in noisy scanned documents

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.502430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:eec909dabe7e8667cd1a474c015ad08756e0272ece9e75d72f7ecfdd65411a96

Observation 4afea782-c61d-43ee-947f-e1392bf7c0ee · outbound

This paper cites Swsr: A chinese dataset and lexicon for online sexism detec- tion.Online Social Networks and Media, 27:100182.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Swsr: A chinese dataset and lexicon for online sexism detec- tion.Online Social Networks and Media, 27:100182

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.523077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:4c5ecd0f4f9b022060cfbe2b3349583f4e21b8a2523ea0aebae8991fdb4ba228

Observation 2c113c21-f5cd-499d-ad72-e76bf07d0374 · outbound

This paper cites Fairface: Face attribute dataset for balanced race, gender, and age for bias measurement and mitigation.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Fairface: Face attribute dataset for balanced race, gender, and age for bias measurement and mitigation

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.568271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:40a095356363e2922f56b1d905a07b32ef06aee200110cc1348abae42104be70

Observation 98699c35-12a6-495d-801c-589c964020b3 · outbound

This paper cites PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.264889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:7e5fc87aaf6821f85856f6e45f5c652bf336c268a039ce1a4ea2d3aa4ff8244b

Observation 169c5edd-943f-45e4-937a-6a768a8a5ca2 · outbound

This paper cites Col- laborative evaluation: Exploring the synergy of large lan- guage models and humans for open-ended generation eval- uation.arXiv e-prints, pages arXiv–2310.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Col- laborative evaluation: Exploring the synergy of large lan- guage models and humans for open-ended generation eval- uation.arXiv e-prints, pages arXiv–2310

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.495786Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:b83179750d4cadd2e1c28cd6939f4519e4d27f61017db550d1d9375d96621cee

Observation d8facfe0-c78c-4076-8fc1-ca919cf5a694 · outbound

This paper cites PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.220898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:591182a6e5b21ffc3be1c5d55d55ea902be928c364fdf370216606539ece1882

Observation 341f8510-3cea-4988-989c-c88264d18016 · outbound

This paper cites Rule-based data selection for large language mod- els.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Rule-based data selection for large language mod- els

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.255484Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:0097dcb007295e3702739caa9ba78cd3c0c27e4ca816dd003763aade86a55d7a

Observation 86caa8fe-162d-4fb6-ad5a-432c8a91de85 · outbound

This paper cites Mcfend: A multi-source benchmark dataset for chinese fake news de- tection.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Mcfend: A multi-source benchmark dataset for chinese fake news de- tection

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.504854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:ea366b980405b2ea85b67142746344692f1722f647d8fb5129b4fb97e9d30b07

Observation 188ac597-16b6-4ce8-b2f9-11e8718ccef4 · outbound

This paper cites LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.267894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:aa9032ca26c429d506212dce5e85fb9a26bd8d741b95370d103afa37f2c449f8

Observation 44b7f6b5-befc-4a3f-b9d5-4c2609bace60 · outbound

This paper cites DeepSeek-V3 Technical Report.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models DeepSeek-V3 Technical Report

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.194479Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:c30c50f8b3d7509c485e8fe7bd0e20433bcbe0f8467e78260bca73175c05cbe9

Observation 81dd585a-bf5e-4972-b1aa-339f9e7480ed · outbound

This paper cites Mm-safetybench: A benchmark for safety eval- uation of multimodal large language models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Mm-safetybench: A benchmark for safety eval- uation of multimodal large language models

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.573664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:a9ff7ce3262fc7b5bbd9db3b1c8cff4bd752ad6ad33d67bda5b5a7335266817b

Observation 950c5bdf-9ef4-480c-928b-a72663570ea8 · outbound

This paper cites G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.214656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:875115b7ef3c27a25a4fbd4873e3e438f5be2f782e5f49e4a5903cc28bed543b

Observation 55380fa7-9fa9-4b1c-b990-133244ef57da · outbound

This paper cites Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.271111Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:abc16ee3bdc1f82ca8ecc830efba41188551a50087ce0c6ee721de6955e55e48

Observation 7605bdb1-3a8b-4a27-ac1f-4a6f092cf6d6 · outbound

This paper cites Pv-vtt: A privacy-centric dataset for mission- specific anomaly detection and natural language interpreta- tion.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Pv-vtt: A privacy-centric dataset for mission- specific anomaly detection and natural language interpreta- tion

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.594395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:3a7e58d7febbf226e5e993f433c302d0d69f3d22255f7f6310ec7cda793f93fe

Observation 1c10f3f5-0245-4ccb-8b8e-6db5c1f5238d · outbound

This paper cites Ethos: a multi-label hate speech de- tection dataset.Complex & Intelligent Systems, 8(6):4663– 4678.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Ethos: a multi-label hate speech de- tection dataset.Complex & Intelligent Systems, 8(6):4663– 4678

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.536166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:f5d1b878fa2aa7fc7b97efd98a79aabd2eb978a3add273fe39cc0b2e43a45434

Observation 420d837a-209c-4bfd-9fd3-4b05dd16030b · outbound

This paper cites Detecting potential violent be- havior using deep learning.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Detecting potential violent be- havior using deep learning

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.500090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:3750b4c9d2d51e030873986b6bdfce95d11cc6aa240643534062816dfca39b08

Observation d4be4337-c3df-4f26-9bef-f00021ce0cf8 · outbound

This paper cites BBQ: A Hand-Built Bias Benchmark for Question Answering.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models BBQ: A Hand-Built Bias Benchmark for Question Answering

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.261552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:93a030062278578e43f4f4091ca6c0e81794f451aeafe760274d9e0a98f48ea8

Observation 05c04b6c-4f38-417b-889e-5a5dac4de612 · outbound

This paper cites Fakesv: A multi- modal benchmark with rich social context for fake news de- tection on short video platforms.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Fakesv: A multi- modal benchmark with rich social context for fake news de- tection on short video platforms

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.547078Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:37024cc6d8d3a801504f5168d94182b56623e890eade587c5bcbf6f03c90fda4

Observation 44d68da1-b45e-4ec9-94fb-ea9daa82f868 · outbound

This paper cites Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.217680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:5782f0fba5b71bf6e617312717b1fa5adbc82fcea2c9dc55911d6bb0f7e75c28

Observation 79e9197d-ba8b-460e-84ca-5c8346ac9114 · outbound

This paper cites Fine-tuning aligned language models compromises safety, even when users do not intend to!.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Fine-tuning aligned language models compromises safety, even when users do not intend to!

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.518524Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:d658d4ea34039109730f8f218b42ef105597b6ef06a3f081a3a3e822260173aa

Observation 49beb48a-a0ad-4f02-a877-349e65cc76c0 · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 43

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.274048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:ec517b4ef4313d09a211cefc6cd1a4921f65efc5be546295c48fffc6289b4a89

Observation 9a8c8a0e-b6e4-4fdb-a378-be689fafc80b · outbound

This paper cites AudioSet.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models AudioSet

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.577965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:3b303ccdca8a74f3f48dec1a9e25a1dce3eff0661ed0f4ec478fb551d38995ff

Observation ac57f132-57fe-4758-bbb3-fd853ff37429 · outbound

This paper cites Hate speech detection in the bengali lan- guage: A dataset and its baseline evaluation.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Hate speech detection in the bengali lan- guage: A dataset and its baseline evaluation

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.497991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:fcce1723f8d7d64a723e5adfa0a71a34e355ee0a5d6fe2ddf8d5357d9b3c7a42

Observation b120e03f-5ea0-45cc-a226-56db728611d3 · outbound

This paper cites Who validates the validators? aligning llm-assisted evaluation of llm outputs with human preferences.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Who validates the validators? aligning llm-assisted evaluation of llm outputs with human preferences

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.520852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:90b30405e38f668d27b96e4dd37ee19ef30c78c10b15caba2fafc7aff89489d2

Observation 6a834ebf-f028-476f-9414-5413cb46c7ce · outbound

This paper cites Overview of ccl23-eval task 8: Chinese essay fluency eval- uation (cefe) task.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Overview of ccl23-eval task 8: Chinese essay fluency eval- uation (cefe) task

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.570498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:9bad597a2be5a1845c6a34a0b11937108a8419b4aac20d67015871360f443a3e

Observation 52e45f61-fbdf-4c68-b3a1-feb0668bcf1f · outbound

This paper cites Real-world anomaly detection in surveillance videos.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Real-world anomaly detection in surveillance videos

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.575961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:1ab00ed36f4e3e5256ae1a83eec686487bd06469e1914f4d1e306021bd31ee55

Observation e76d5fb2-16a1-448c-bb15-c5009ce07ae8 · outbound

This paper cites Case-bench: Context-aware safety bench- mark for large language models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Case-bench: Context-aware safety bench- mark for large language models

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.582582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:d8b738fead98d9b7a31d43eef235d4070ba4d244bceecbe5ba8791b05c4acc2b

Observation a7af2d15-d6fc-4dd6-a899-7e1ad6a5ae9e · outbound

This paper cites Safety Assessment of Chinese Large Language Models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Safety Assessment of Chinese Large Language Models

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.201586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:8f7ea0ca084e1f4b3559cad161d35edeef6ea49769fedce26fc39b8e803e8a21

Observation e752d3d0-1aee-489e-b3ed-8273c6d81d6f · outbound

This paper cites TrustLLM: Trustworthiness in Large Language Models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models TrustLLM: Trustworthiness in Large Language Models

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:17:09.209714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:8fea6d2d87438633a256240a5f7bd93039aec8fff1ca428df0a6ef1afa1e8314

Observation 766de1cf-41aa-4c03-afc6-01e9e0a3558c · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 52

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.208099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:ad7b3dbff25adf6d36a919d2b10f42856be3047184c0c59cf4d1d343676a438a

Observation b049805a-607b-4e8f-b383-367b4963bad0 · outbound

This paper cites How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.252260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:3ebc4553b51a2486ad67bf54af0bad0dcd46da79a253043f2f4bc751af4dd80a

Observation c5fc44d4-d30d-4ff2-8a91-d6e7e1c8669a · outbound

This paper cites A study on integrating machine learning tech- niques for waste management.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models A study on integrating machine learning tech- niques for waste management

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.560795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:86b29043376fcc6007bc444b9053853c862be5c8c5142c4bf12ed4b45b677c76

Observation 3aae70bb-99d7-440a-8d2f-55425963be5c · outbound

This paper cites Belgian man dies by suicide following ex- changes with chatbot.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Belgian man dies by suicide following ex- changes with chatbot

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.587137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:e13f2c501c52422d23706653b6ef7d9e6f6992c361b36df9866c28f7267490f5

Observation ce015680-0e26-47a9-b530-9c452d7c4915 · outbound

This paper cites Pdid: database of molecular-level puta- tive protein–drug interactions in the structural human pro- teome.Bioinformatics, 32(4):579–586.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Pdid: database of molecular-level puta- tive protein–drug interactions in the structural human pro- teome.Bioinformatics, 32(4):579–586

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.565767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:ac3daf59dafd02a96d4bb4c8bc97313882dbf8e34dd43d1b93e24b7b9006aeff

Observation f00c0a4e-4693-45ca-84dc-4d9abf9371eb · outbound

This paper cites Multihateclip: A multilingual benchmark dataset for hateful video detection on youtube and bilibili.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Multihateclip: A multilingual benchmark dataset for hateful video detection on youtube and bilibili

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.589534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:5bba74983570f7b945e2bfc8d5d501cc155b9f340d10c2ba87ddbc3fb4ac30ea

Observation 8946c779-439d-4130-9f71-9b90eae31c70 · outbound

This paper cites Cnn-generated images are surprisingly easy to spot.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Cnn-generated images are surprisingly easy to spot

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.584837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:27586811d3b4f0fdee23afa0eb2fc46b8544c169181dc5a21f3a197e090e766e

Observation 248c1832-0d7b-43f0-b770-5ed93f46fbc8 · outbound

This paper cites Multimodal llm enhanced cross- lingual cross-modal retrieval.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Multimodal llm enhanced cross- lingual cross-modal retrieval

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.580219Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:a0398637901d734214ae9104ce1d701dc873df42784c745c45c4bb22d791db8e

Observation 5de3b0d0-f0ff-49d9-b094-31d3cb50b857 · outbound

This paper cites Safebench: A benchmarking platform for safety evaluation of autonomous vehicles.Advances in Neural Information Processing Systems, 35:25667–25682.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Safebench: A benchmarking platform for safety evaluation of autonomous vehicles.Advances in Neural Information Processing Systems, 35:25667–25682

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.554063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:aab84a77216a636e11a4802b6e3712da97a041fa7302d3acbc9b137952771fbb

Observation 37fcecaa-d9bc-4211-ae45-036e9db1a56e · outbound

This paper cites Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models.IEEE Transactions on Pat- tern Analysis and Machine Intelligence.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models.IEEE Transactions on Pat- tern Analysis and Machine Intelligence

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.544701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:a3da204e43fde77ee42dde71958447d678ff26af8ef6ce80f94707e830f424d5

Observation 6fc15024-0c61-4aa2-9ddf-8c353335db91 · outbound

This paper cites LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding

Reference 62

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.197949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:96ccb758300e5c4ee3686cc765cb7e1a5c2c11a6945c072276a512a52dc02406

Observation d8188977-9b7f-41a6-9ba6-45ddc0e9fdd8 · outbound

This paper cites Lamm: Language-assisted multi- modal instruction-tuning dataset, framework, and bench- mark.Advances in Neural Information Processing Systems, 36:26650–26685.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Lamm: Language-assisted multi- modal instruction-tuning dataset, framework, and bench- mark.Advances in Neural Information Processing Systems, 36:26650–26685

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.509422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:0ab78154b5e91668697be8a3faccfc6c22129e1ef127fb91c5717e9413a851d2

Observation 01baa8ea-d060-4c0f-8009-3b53ebd1fc81 · outbound

This paper cites an unresolved cited work.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Unresolved cited work

Reference 64

Resolution
unresolved
raw_fallback, observed 2026-05-17T22:30:23.540294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:17d9fb6393cd750cd0388060ebf02138099cb862ae42e58e487bf0c4254875ab

Observation 6dd6879e-960f-41ff-b8b4-b7032ffe2f96 · outbound

This paper cites Timesuite: Improving mllms for long video understanding via grounded tuning.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Timesuite: Improving mllms for long video understanding via grounded tuning

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.533914Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:366e17a24f18de39670ee1947227fffb02ded25ac5d5eb2dfeef421136ef2c41

Observation d75cc30b-9f41-49de-9bc9-59e7826bc537 · outbound

This paper cites Exo2ego: Exocentric knowledge guided mllm for egocentric video understanding.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Exo2ego: Exocentric knowledge guided mllm for egocentric video understanding

Reference 66

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.204881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:0cb554ad1cf0825fcc1959b846c4a72730008082c50b0d06c2d716acb9a88f8e

Observation f6e31873-1ee6-463e-afd2-a6992fca8476 · outbound

This paper cites Differential-perceptive and retrieval- augmented mllm for change captioning.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Differential-perceptive and retrieval- augmented mllm for change captioning

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.529528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:388341544f9007cfe4ec1a449966d8489263d619bfc048192c4baaf8abce909a

Observation 7a598fdc-efba-4daa-b5c0-c15f8c30046e · outbound

This paper cites Multitrust: A comprehensive bench- mark towards trustworthy multimodal large language mod- els.Advances in Neural Information Processing Systems, 37:49279–49383.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Multitrust: A comprehensive bench- mark towards trustworthy multimodal large language mod- els.Advances in Neural Information Processing Systems, 37:49279–49383

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.558564Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:67a79320c4d9d8db397b09ba6a33dc41f2bf6b2a7f4a1bcc58df8f1cba9893bb

Observation 656485e0-10b7-4be0-9511-396446ca99ff · outbound

This paper cites Efficient motion-aware video mllm.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Efficient motion-aware video mllm

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.549207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:1202c35fc7ae44a390274f9704d75204ab77082ae1c8b01c920cbafdc05a6b60

Observation 3cbec8e2-f604-4261-bde9-11cf86bdb1ff · outbound

This paper cites Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.507179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:1fd3593e7b4be9b76b4f68dbc65abc7cc55182575ad0013068a5bb32623ee129

Observation c955c24a-2855-41f8-ab71-0f3a52fd07ec · outbound

This paper cites Image-based table recognition: data, model, and evaluation.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Image-based table recognition: data, model, and evaluation

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.538345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:d54a993c2dc4572b0d17454b1f9de06efcd348ffbcb5c8f34e73c7db8f49340a

Observation c5303516-bf73-4f80-9788-71367453667c · outbound

This paper cites Places: A 10 million image database for scene recognition.IEEE transactions on pattern analysis and machine intelligence, 40(6):1452–1464.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Places: A 10 million image database for scene recognition.IEEE transactions on pattern analysis and machine intelligence, 40(6):1452–1464

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.563421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:1f195824905e236491010e80fc6fade1c1b68f0c8a268b34cfcbaf5dd12cea12

Observation 7f35fc20-bda6-4e44-98d3-5ff8b45fc560 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 73

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:30:23.224376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:02665646c02c16708ebebd4e124b9f4b480de0555279f7004a7b788ae383f31f

Observation 58a719bb-ecbb-4d06-aa27-1a54607dc3bd · outbound

This paper cites A detailed break- down of the dataset sources and their corresponding content domains is presented in Table 5.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models A detailed break- down of the dataset sources and their corresponding content domains is presented in Table 5

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.542613Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:b1701e441f1cd8f09188444dcd04b500b19001c0d6a5ce0405e8f63a6193f855

Observation c5d2c4f8-04da-4427-be11-ec53d09776a5 · outbound

This paper cites role": "system.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models role": "system

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.516163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:016997d49896b0890477a719b75bf22238065ae636cad584119fa79b28cba210

Observation 585544d9-4b99-40e4-a5da-b8ba850e5650 · outbound

This paper cites Privacy and Property.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Privacy and Property

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.513991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:e0adbb26040e0d6777b999d4e2f82c312f5af81c0a3c958fe72ddf30497152ae

Observation 42037712-91de-47b6-bed5-7e37dfef8bce · outbound

This paper cites This subset covers balanced distributions across nine risk categories and four modalities (text, image, audio and video), with detailed data shown in the table 4.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models This subset covers balanced distributions across nine risk categories and four modalities (text, image, audio and video), with detailed data shown in the table 4

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T22:30:23.551964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:ce0a6cb9c3d58eaebe5e24f053091b16e794f04c8d84ccfda47d7b596d7b979a

Observation b5666f61-8bfa-479a-8826-12c0d12d6b6b · outbound

This paper cites an unresolved cited work.

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Unresolved cited work

Reference 78

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:30:23.258567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-17T22:29:36.960961Z digest=sha256:be62ab95509cdbc68e351b3e36d15414ddb2e14a1a5132be840370cbd0374481

Pith citing papers

Observation fed8506a-f643-4fc8-98cf-1dbb98905cbc · inbound

VoxSafeBench: Not Just What Is Said, but Who, How, and Where cites this paper.

VoxSafeBench: Not Just What Is Said, but Who, How, and Where OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

Reference 62

Resolution
verified exact
local_arxiv, observed 2026-05-10T10:24:22.003486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-10T10:19:28.041282Z digest=sha256:508a28ad2f36abd01c32b4958dcb83fd124ce0a3e68f30c1d1b59e793bfe20f9

Observation 0a0e02a2-eef3-42e0-b8d8-1f226f359c8b · inbound

Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs cites this paper.

Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-07-02T17:27:14.958299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T22:03:49.204596Z digest=sha256:20b29432fe24131c28164a5c3f645d93d5ddb56a7d2824a04ad93ff2033f4f0f

Observation 9921a8aa-53d0-4ed6-8c6d-f66a804b1077 · inbound

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation cites this paper.

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-02T02:44:16.755987Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:44:16.755987Z digest=sha256:7bd4dd0809ed1d2d25433074a0e24c3a75c5777bfb72d266b0bdc0b864586a39