{"as_of":"2026-08-13T12:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58fed5391635f2d28d86e4aa344d26c8e5835ef5852d9a6ffa007c65b2dcea31","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T22:29:36.960961Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:44:16.755987Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T17:27:14.956941Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"cited_work":{"arxiv_id":"2511.10287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.10287","snapshot_observed_at":"2026-07-02T17:27:14.956941Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","venue":"cs.LG","work_id":"2272eb16-6e5e-4dbd-9e18-1b6af38030d3","year":2025},"citing_paper":{"arxiv_id":"2604.14548","last_updated":"2026-04-20T07:51:45Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:24:59Z","title":"VoxSafeBench: Not Just What Is Said, but Who, How, and Where","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T10:19:28.041282Z"},"links":{"cited_paper":"/paper/2511.10287","citing_paper":"/paper/2604.14548"},"observation_digest":"sha256:528cd7360e218601ae61d67ab30a2afd37be5ae9809eb58836c9dac06fcecefa","observation_id":"fed8506a-f643-4fc8-98cf-1dbb98905cbc","resolution":{"observed_at":"2026-05-10T10:24:22.003486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"cited_work":{"arxiv_id":"2511.10287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.10287","snapshot_observed_at":"2026-07-02T17:27:14.956941Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","venue":"cs.LG","work_id":"2272eb16-6e5e-4dbd-9e18-1b6af38030d3","year":2025},"citing_paper":{"arxiv_id":"2606.07175","last_updated":"2026-06-05T11:41:39Z","snapshot_observed_at":"2026-08-01T09:18:30.921777Z","submitted_at":"2026-06-05T11:41:39Z","title":"Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T22:03:49.204596Z"},"links":{"cited_paper":"/paper/2511.10287","citing_paper":"/paper/2606.07175"},"observation_digest":"sha256:0e2161cb90ce36702d28e519027c4b5bcaef85929749c9352508697b788e30da","observation_id":"0a0e02a2-eef3-42e0-b8d8-1f226f359c8b","resolution":{"observed_at":"2026-07-02T17:27:14.958299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10287","snapshot_observed_at":"2026-08-02T02:44:16.755987Z","title":"Outsafe- bench: A benchmark for multimodal offensive content detection in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-07T21:24:52.953909Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.755987Z"},"links":{"cited_paper":"/paper/2511.10287","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:7bd4dd0809ed1d2d25433074a0e24c3a75c5777bfb72d266b0bdc0b864586a39","observation_id":"9921a8aa-53d0-4ed6-8c6d-f66a804b1077","resolution":{"observed_at":"2026-08-02T02:44:16.755987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.10287/citation-record","integrity":"/paper/2511.10287/integrity","json":"/paper/2511.10287/citation-record.json","paper":"/paper/2511.10287"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2d03810a-5d58-45d3-938d-cdfc3c7e28d2","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:9a82e0f81c16f5901f335fc45ffb23be8a22efceec9fb1071aa177572187fd59","observation_id":"545088ee-9011-4783-861f-f3209b9fe15d","resolution":{"observed_at":"2026-05-17T22:30:23.615677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meet claude, your thinking partner","venue":null,"work_id":"0be4e6e2-0675-49c7-b23c-0c2fba61ee99","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:bd06c7b6885bc12339e92cac2ee238e76db9b7900a99e52fe4bfc64505f69ac3","observation_id":"67d161cc-e878-4da4-9875-e3a76ccbb242","resolution":{"observed_at":"2026-05-17T22:30:23.602024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doubao 1.5 pro: Api pricing & how to use doubao- 1.5-pro api","venue":null,"work_id":"32d948a7-ebb0-494c-96bc-979d46907a30","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:6fe386183410a89e4ed103b66d50340b39853d752f1cf8738254fa86199040e5","observation_id":"c2fc2b58-d671-4fe2-803e-fe973b1bb454","resolution":{"observed_at":"2026-05-17T22:30:23.599684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:9b09667f3c322b93d8a63faee279a2169eb773687c5e04f73cfa4717fea2fd91","observation_id":"9350da11-2342-47f5-9208-873b5e72b1bb","resolution":{"observed_at":"2026-05-17T22:30:23.283600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing pcl-baidu wenxin (ernie 3.0 ti- tan), the world’s first knowledge enhanced multi-hundred- billion model","venue":null,"work_id":"853b400c-2ab6-4956-b2cf-bbfb31326810","year":2021},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:ba75e5c66f44d86d0a061b878f22819e1a6d65bc89b5c2b0b788690c981903e4","observation_id":"322959a1-b5ac-4d13-8dfe-9c690e9dc102","resolution":{"observed_at":"2026-05-17T22:30:23.604392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05583","last_updated":"2024-03-02T21:15:24Z","snapshot_observed_at":"2026-08-13T04:04:52.378823Z","submitted_at":"2024-03-02T21:15:24Z","title":"A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition","version":1},"cited_work":{"arxiv_id":"2403.05583","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.05583","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A cross-modal approach to silent speech with llm-enhanced recognition","venue":null,"work_id":"0bf839cb-fb86-40d8-b7a3-bb9f2479b07d","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2403.05583","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:32602bd465a95e805bacbf768733c8ea4d72305b164326e849a8f782d881b1ea","observation_id":"5b50bdfe-b856-43ad-aace-7504aa9a4dfe","resolution":{"observed_at":"2026-05-17T22:30:23.280520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Murder without redress-the need for new legal solutions in the age of character-ai (cai).Avail- able at SSRN 5107942","venue":null,"work_id":"e6d77960-de56-4cbd-b89a-6a54ad0d2e3e","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:5c7630c971ca09d3a201a3ba5bc10b16446861551e9d74181efa33bf62cf00da","observation_id":"dfc5f065-f81d-4bf2-9fa5-81d648d9e70a","resolution":{"observed_at":"2026-05-17T22:30:23.606593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Suppression of acoustic noise in speech us- ing spectral subtraction.IEEE Transactions on acoustics, speech, and signal processing, 27(2):113–120","venue":null,"work_id":"0247e5d9-2013-4844-b582-917adf93e37f","year":2003},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:c366d01ec4ac18bb5c58d5ddf9718e8c37a81a93198636ac2c0d62fa345149b4","observation_id":"70597037-a1a0-4065-a1d0-cce541816cd3","resolution":{"observed_at":"2026-05-17T22:30:23.597225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":"2308.07201","doi":"10.48550/arxiv.2308.07201","metadata_source":"pith","pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","venue":"cs.CL","work_id":"eac74d79-d8d1-49dd-8565-53d713a84fff","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:0400b52cbef18dec4e7c77d7c6df10920c975e44b06bbdc330739aebf24cf024","observation_id":"ad478650-8f62-447d-bfe0-dae4e48f6501","resolution":{"observed_at":"2026-05-17T22:30:23.286668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.267447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.267447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar 2019 robust reading challenge on scanned receipts ocr and information extraction.Web link: https://rrc","venue":null,"work_id":"8b4cc48e-d5af-403b-9ba4-74c841d1a066","year":2019},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:81d8dfe33b0430689c5cde0691a930ab089c909d14287979a344df6f54b7c893","observation_id":"427ab5e3-e48b-49de-9828-4484fa4d2808","resolution":{"observed_at":"2026-05-17T22:30:23.618263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-08-13T05:31:57.505215Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":"2311.03287","doi":"10.48550/arxiv.2311.03287","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic analysis of hallucination in gpt-4v (ision): Bias and interference chal- lenges","venue":"arXiv (Cornell University)","work_id":"a39b177c-6624-4310-9837-526645915677","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:c147ad55be261a844f0a934d3f4e87d2f576ea84353397338a0e069fd4426561","observation_id":"120d8ccb-a6e9-43a6-b27c-786c1fa9b044","resolution":{"observed_at":"2026-05-17T22:30:23.277475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hatemm: A multi- modal dataset for hate video classification","venue":null,"work_id":"464c2cdd-fa59-483f-871a-c76bcafa129d","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:00028f337b3ebbb99e1e5d86449e1fc719dd347fb5947afa3bdf32d6daa856d3","observation_id":"0d00c9ef-8190-41a5-b2c9-9a45c9c529d4","resolution":{"observed_at":"2026-05-17T22:30:23.611261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The pascal visual object classes (voc) challenge.International journal of computer vision, 88:303–338","venue":null,"work_id":"ba9ba339-6f26-4419-b7d2-1c0f0e9a16d0","year":2010},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:d508e9607c7fbb3132bfd96c438cd78368301d03512f42bad045c8e3a86f389f","observation_id":"9b022462-54a5-437b-94ad-c07833bb2f7f","resolution":{"observed_at":"2026-05-17T22:30:23.613678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"guided mllm reasoning: Enhancing mllm with knowledge and visual notes for visual question answering","venue":null,"work_id":"bb7f0365-27aa-414f-8015-9a5db0c04055","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:c261435efa72ce24f7662d3dbef8dd020445f70b8f82805a46ce37f2e740dad1","observation_id":"053fec9f-3bea-4633-9b5e-dfa6fc320e8b","resolution":{"observed_at":"2026-05-17T22:30:23.609022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19806","last_updated":"2024-10-08T08:39:04Z","snapshot_observed_at":"2026-08-12T22:28:25.804914Z","submitted_at":"2024-10-08T08:39:04Z","title":"Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing","version":1},"cited_work":{"arxiv_id":"2412.19806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19806","snapshot_observed_at":"2026-07-04T15:09:55.188348Z","title":"Vitron: A unified pixel-level vision llm for understanding, generating, segmenting, editing","venue":null,"work_id":"995765de-369f-48fc-a3f5-e4b66a188243","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2412.19806","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:9277398969a0de4ac1a485da85cc6c1fcbb9322ede466f889dd3250b3c077e51","observation_id":"af544a11-ca92-4b35-afd6-4d48996ca1d5","resolution":{"observed_at":"2026-05-17T22:30:23.211554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Find any sound you like","venue":null,"work_id":"5be3ad73-cc01-45ee-9004-2920c3613093","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:924f915da8fb4d78a470304a2d53175e17da518d2454bef05d91108a740366a2","observation_id":"0ca0d029-9808-42bd-8993-93559f010943","resolution":{"observed_at":"2026-05-17T22:30:23.493611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"42e99d63-bfc1-46e5-9721-74b94b3ff0cc","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:1fced8356c28096d40a04e2219482dfc39ac87aadf25a906b5b595af74a42a0e","observation_id":"05a88bb0-9530-4eb5-a1c1-3a09a9defdbe","resolution":{"observed_at":"2026-05-17T22:30:23.525133Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini: Our most intelligent ai models","venue":null,"work_id":"82f24650-beac-4b04-b44e-f1c5b2c640f6","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:1042a6e041d514bfb918160e9655afffcf0a6bb3c2369be61edc2356151e229e","observation_id":"44ecccc0-0f8c-488c-8687-1fef96871477","resolution":{"observed_at":"2026-05-17T22:30:23.527165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllmguard: A multi-dimensional safety evalua- tion suite for multimodal large language models.Advances in Neural Information Processing Systems, 37:7256–7295","venue":null,"work_id":"371dae8f-707b-4eb0-b66a-316904f545b0","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:5d81e6eba27e086234964726c4e894817927628724b72cd01eff31a13b0ce080","observation_id":"52909e12-401b-468a-a600-2ca20dd23176","resolution":{"observed_at":"2026-05-17T22:30:23.591955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A large-scale comprehensive dataset and copy-overlap aware evaluation protocol for segment-level video copy detection","venue":null,"work_id":"dc8b66d7-2c31-4e52-9bde-a90cf49d6474","year":2022},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:213f59e69f2c71dd9e4c3d56ab47cfa1682f217924e525525d5ba4d0c1208fd2","observation_id":"b1c77cfb-29a2-410c-9b66-b875850e17d2","resolution":{"observed_at":"2026-05-17T22:30:23.511673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepfake detection using deep learning meth- ods: A systematic and comprehensive review.Wiley Interdis- ciplinary Reviews: Data Mining and Knowledge Discovery, 14(2):e1520","venue":null,"work_id":"fe802544-8ec4-4a1b-bdd0-9cd241c1951e","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:aa34f7dc7f0fa1803057615a048c5d9a3e1da1c4dac89aca6dc1b6e106670c3c","observation_id":"b39721ac-9924-46db-b516-08cc611bf8d9","resolution":{"observed_at":"2026-05-17T22:30:23.556321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o: The cutting-edge advancement in multimodal llm.Authorea Preprints","venue":null,"work_id":"835c1a0d-7066-4c98-ac4f-7fbfd9c9bfbc","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:f4d45be8f7832ec1be7de2ca433a579029e8716049216a5e8c00c986c3a1fc6a","observation_id":"6211f762-6bbb-4761-ba08-4cbf70b0d8dd","resolution":{"observed_at":"2026-05-17T22:30:23.531686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Funsd: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"6c46020a-cfde-46e2-ae44-9524d923f331","year":2019},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:345b11b727914c2392c8d741a3c8fe3631cb46ef1e00ee492a431a54f536b75e","observation_id":"739972c1-18f7-4de9-925d-a0f891d4380f","resolution":{"observed_at":"2026-05-17T22:30:23.502430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swsr: A chinese dataset and lexicon for online sexism detec- tion.Online Social Networks and Media, 27:100182","venue":null,"work_id":"00e8f6c8-6aaf-4d39-bb52-a28f6b5b9ef5","year":2022},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:563c8d3b30005caa759edc0aca8ce81cc99698548eb62e0e07d276aabd908ec0","observation_id":"4afea782-c61d-43ee-947f-e1392bf7c0ee","resolution":{"observed_at":"2026-05-17T22:30:23.523077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fairface: Face attribute dataset for balanced race, gender, and age for bias measurement and mitigation","venue":null,"work_id":"f304b07e-8aa6-4d73-9c00-61b528c22afa","year":2021},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:ecfd9af94a2ebaf8ab28ae4d992f016f4e0b34ec7c0a328201dcf4de931ecd17","observation_id":"2c113c21-f5cd-499d-ad72-e76bf07d0374","resolution":{"observed_at":"2026-05-17T22:30:23.568271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13564","last_updated":"2025-02-19T09:17:07Z","snapshot_observed_at":"2026-08-12T19:00:48.370776Z","submitted_at":"2025-02-19T09:17:07Z","title":"PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.13564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13564","snapshot_observed_at":"2026-06-30T12:54:40.154436Z","title":"Priv-qa: Privacy-preserving question answering for cloud large language models","venue":null,"work_id":"4eb2deff-8556-48b4-a730-b0e7ef1fa8c0","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2502.13564","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:fc26cc10db4de56d4fd4362a22f4d4849d05a271229bf2d92ddec479507be689","observation_id":"98699c35-12a6-495d-801c-589c964020b3","resolution":{"observed_at":"2026-05-17T22:30:23.264889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Col- laborative evaluation: Exploring the synergy of large lan- guage models and humans for open-ended generation eval- uation.arXiv e-prints, pages arXiv–2310","venue":null,"work_id":"65777c57-93e5-4b20-9037-6259dc7b97d1","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:d895a641428a9b682c91b0bc4b9ced6093442954545a13fe61f7f8fcc691b957","observation_id":"169c5edd-943f-45e4-937a-6a768a8a5ca2","resolution":{"observed_at":"2026-05-17T22:30:23.495786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02762","last_updated":"2024-12-31T06:54:19Z","snapshot_observed_at":"2026-08-13T11:01:51.955723Z","submitted_at":"2023-07-06T04:05:44Z","title":"PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations","version":3},"cited_work":{"arxiv_id":"2307.02762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02762","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prd: Peer rank and discussion improve large language model based evaluations","venue":null,"work_id":"335269be-446d-4bc9-a4cd-1c168dc5c6c9","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2307.02762","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:e1627618a9986bf2423c9bb346cdbeb2129a1cd9f5b2876b2e5c64ca054644ac","observation_id":"d8facfe0-c78c-4076-8fc1-ca919cf5a694","resolution":{"observed_at":"2026-05-17T22:30:23.220898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.04715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:19:34.987002Z","title":"Rule-based data selection for large language mod- els","venue":null,"work_id":"2cf59e47-88db-4be5-b6ee-51d11ea1c7c9","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:36c03957f32befd3358e522197a6ebf2a1e5e58eec52978049f9a6b7375c4598","observation_id":"341f8510-3cea-4988-989c-c88264d18016","resolution":{"observed_at":"2026-05-17T22:30:23.255484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mcfend: A multi-source benchmark dataset for chinese fake news de- tection","venue":null,"work_id":"d9bd0b98-c0c7-49c7-bd87-b101f20abc7c","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:b94336340e457ba0b2a16c8210d16e179d10d43b8af7094f9be03dfabe54613c","observation_id":"86caa8fe-162d-4fb6-ad5a-432c8a91de85","resolution":{"observed_at":"2026-05-17T22:30:23.504854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-13T11:35:56.374662Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.13711","doi":"10.48550/arxiv.2305.13711","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm-eval: Unified multi-dimensional automatic evaluation for open-domain conversations with large language models","venue":"arXiv (Cornell University)","work_id":"ecab5a50-9f87-4819-902a-2df7c2d195ae","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:2479ad691fd13730f8a26dc5910ba534bba1e333e3647db5343b6f9c77af8586","observation_id":"188ac597-16b6-4ce8-b2f9-11e8718ccef4","resolution":{"observed_at":"2026-05-17T22:30:23.267894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:4500d1846405264204341420d0682e050a53bd6789e3a0aee1aa673873927dc6","observation_id":"44b7f6b5-befc-4a3f-b9d5-4c2609bace60","resolution":{"observed_at":"2026-05-17T22:30:23.194479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-safetybench: A benchmark for safety eval- uation of multimodal large language models","venue":null,"work_id":"baada9bd-1f97-4425-9f21-044c3dddc119","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:01d0b99b9236c80c881df645938f219a221a9f10191ddf2961210a90d304394a","observation_id":"81dd585a-bf5e-4972-b1aa-339f9e7480ed","resolution":{"observed_at":"2026-05-17T22:30:23.573664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":"2303.16634","doi":"10.48550/arxiv.2303.16634","metadata_source":"pith","pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","venue":"cs.CL","work_id":"6bc7f654-ec90-4d95-b023-416717a28f45","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:f69737d747ab8af59c66b875127d9572cccdb52409ac8a8a476a5c3cb153f46f","observation_id":"950c5bdf-9ef4-480c-928b-a72663570ea8","resolution":{"observed_at":"2026-05-17T22:30:23.214656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:05.615976+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:05.615976+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":"2308.05374","doi":"10.3390/su15053939","metadata_source":"pith","pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","venue":"cs.AI","work_id":"d518ae99-5488-4834-83a4-63e88f9878dc","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:f1018fb5c1b6af8aa0ad1452e19000aec08254b0102d6d59db1b163dc29e7b97","observation_id":"55380fa7-9fa9-4b1c-b990-133244ef57da","resolution":{"observed_at":"2026-05-17T22:30:23.271111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pv-vtt: A privacy-centric dataset for mission- specific anomaly detection and natural language interpreta- tion","venue":null,"work_id":"0572ac6c-61f3-43d6-90ad-c4e4791667bf","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:6325262cbc1cc31457a1ebf4f37808e5e578a4442bfd11ebec42dbe3d264c4b4","observation_id":"7605bdb1-3a8b-4a27-ac1f-4a6f092cf6d6","resolution":{"observed_at":"2026-05-17T22:30:23.594395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ethos: a multi-label hate speech de- tection dataset.Complex & Intelligent Systems, 8(6):4663– 4678","venue":null,"work_id":"dac55936-f5af-4e8f-9747-fd968d7b5439","year":2022},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:966549a0b6bc689c153e5f2343cf3e87de9b9c2dcaeaefef39343caa99679bf0","observation_id":"1c10f3f5-0245-4ccb-8b8e-6db5c1f5238d","resolution":{"observed_at":"2026-05-17T22:30:23.536166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting potential violent be- havior using deep learning","venue":null,"work_id":"7e1b1c4f-738f-43af-ab68-64f07baa9aaa","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:dd2cea4ba972991bb6436e96b4bc5df3849e1426021ee240d09bcdf7edb19bc6","observation_id":"420d837a-209c-4bfd-9fd3-4b05dd16030b","resolution":{"observed_at":"2026-05-17T22:30:23.500090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":"2110.08193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-07-04T19:50:11.112541Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","venue":"cs.CL","work_id":"6f78b350-8a2a-4d00-9090-41971c52baaf","year":2021},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:209087ada7fa358096f6c0f20324f570a286d168481854dcd7ff564edf866ecd","observation_id":"d4be4337-c3df-4f26-9bef-f00021ce0cf8","resolution":{"observed_at":"2026-05-17T22:30:23.261552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fakesv: A multi- modal benchmark with rich social context for fake news de- tection on short video platforms","venue":null,"work_id":"42ef1962-b441-4667-9672-ed0c043c1f84","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:ffdcd6a53f8e20279cb4fe181dbdd1a8b14e240fba6bb765d9e0839d7882d477","observation_id":"05c04b6c-4f38-417b-889e-5a5dac4de612","resolution":{"observed_at":"2026-05-17T22:30:23.547078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:f9f9ec81c22f76a4d975d3bf9b54283b4f00feab8563bc8ffb8d9acf7c13212f","observation_id":"44d68da1-b45e-4ec9-94fb-ea9daa82f868","resolution":{"observed_at":"2026-05-17T22:30:23.217680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":"df63aadb-9815-4f5b-a19e-7a9332f0d6e9","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:efc8dd7bb9e379431ae006eb2c64bc69c143d703d1d173008dcb7b44a5bac84f","observation_id":"79e9197d-ba8b-460e-84ca-5c8346ac9114","resolution":{"observed_at":"2026-05-17T22:30:23.518524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:8fcc7897368d02e8f96c2243033fa61dbf951301998650510fbfcddc4f14c30f","observation_id":"49beb48a-a0ad-4f02-a877-349e65cc76c0","resolution":{"observed_at":"2026-05-17T22:30:23.274048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioSet","venue":null,"work_id":"d14d8e5d-45ca-481c-8f07-ceb3477f0e9b","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:9bdfe8d738de02ecb7463cc5c01d80526e411bfac56a58ccfdc4eb116f563e08","observation_id":"9a8c8a0e-b6e4-4fdb-a378-be689fafc80b","resolution":{"observed_at":"2026-05-17T22:30:23.577965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hate speech detection in the bengali lan- guage: A dataset and its baseline evaluation","venue":null,"work_id":"12f32353-4a75-4005-be49-e7e3e9586443","year":2020},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:60ba3d7b070cf5d5e79db7407eb8aa940e4448c8d052e36ecb72c30799dedf05","observation_id":"ac57f132-57fe-4758-bbb3-fd853ff37429","resolution":{"observed_at":"2026-05-17T22:30:23.497991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Who validates the validators? aligning llm-assisted evaluation of llm outputs with human preferences","venue":null,"work_id":"d5f2ba68-0c03-4f92-b7e3-07efb9c82fee","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:26ab791b6eee8de234138a6ff22184d2c00220c996e21e0d108c7159c4bc6174","observation_id":"b120e03f-5ea0-45cc-a226-56db728611d3","resolution":{"observed_at":"2026-05-17T22:30:23.520852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overview of ccl23-eval task 8: Chinese essay fluency eval- uation (cefe) task","venue":null,"work_id":"c3ac7791-bc72-4c92-96d2-fcc4b6499cc8","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:c080430d83637debe751c5c5a2f8c0f52ee4cdfcccfbbe7916cb924c43171ab8","observation_id":"6a834ebf-f028-476f-9414-5413cb46c7ce","resolution":{"observed_at":"2026-05-17T22:30:23.570498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":"9d1d7557-5935-47f6-a559-0e45106b857f","year":2018},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:25d760368375cdc653cf77e4455fd5e495812395288d49483a76b2d35323cb31","observation_id":"52e45f61-fbdf-4c68-b3a1-feb0668bcf1f","resolution":{"observed_at":"2026-05-17T22:30:23.575961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Case-bench: Context-aware safety bench- mark for large language models","venue":null,"work_id":"7109c425-f43e-4b20-a4a4-a87d9790558a","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:b9b5981e2b8c10cbf59ca073af13fb70325920697ed207ebb028fd5b8e456290","observation_id":"e76d5fb2-16a1-448c-bb15-c5009ce07ae8","resolution":{"observed_at":"2026-05-17T22:30:23.582582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10436","last_updated":"2023-04-20T16:27:35Z","snapshot_observed_at":"2026-08-13T11:58:37.271261Z","submitted_at":"2023-04-20T16:27:35Z","title":"Safety Assessment of Chinese Large Language Models","version":1},"cited_work":{"arxiv_id":"2304.10436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.10436","snapshot_observed_at":"2026-07-03T01:07:30.335333Z","title":"arXiv preprint arXiv:2304.10436 , year =","venue":null,"work_id":"9d688004-3580-442d-9134-7139a3f81493","year":2022},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2304.10436","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:bda7ce22a6e9d1b2a1349418f207da87c61287d3878e9fc9094cb076f7e6c8c0","observation_id":"a7af2d15-d6fc-4dd6-a899-7e1ad6a5ae9e","resolution":{"observed_at":"2026-05-17T22:30:23.201586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":"2401.05561","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-07-04T19:50:11.226678Z","title":"TrustLLM: Trustworthiness in Large Language Models","venue":"cs.CL","work_id":"d16f7fcd-8a69-4cc5-b63f-6bb2fe440d76","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:a6cc84e35af523f7232fcef1fd8476648718d20b51d18b9e7d80414920992dae","observation_id":"e752d3d0-1aee-489e-b3ed-8273c6d81d6f","resolution":{"observed_at":"2026-05-18T11:17:09.209714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:b4a3e7058b6d5a36b5a323b93903e0b9838caaa846eab36e0c4eafd990fb642b","observation_id":"766de1cf-41aa-4c03-afc6-01e9e0a3558c","resolution":{"observed_at":"2026-05-17T22:30:23.208099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16101","last_updated":"2023-11-27T18:59:42Z","snapshot_observed_at":"2026-08-13T05:16:05.382907Z","submitted_at":"2023-11-27T18:59:42Z","title":"How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs","version":1},"cited_work":{"arxiv_id":"2311.16101","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16101","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How many unicorns are in this im- age? a safety evaluation benchmark for vision llms","venue":null,"work_id":"560965e5-0712-4c55-989b-ea1c3d2bcb64","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2311.16101","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:975805ce8435cb9c217d7d7a33b9c875468cff449891e59c72c80f32c832374a","observation_id":"b049805a-607b-4e8f-b383-367b4963bad0","resolution":{"observed_at":"2026-05-17T22:30:23.252260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A study on integrating machine learning tech- niques for waste management","venue":null,"work_id":"ec5bc40c-a318-4889-aed8-530855e87531","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:8b74af25e4dbdf14c03881721cfe7b9583f0b4c6447bdb17722c0307b2218c95","observation_id":"c5fc44d4-d30d-4ff2-8a91-d6e7e1c8669a","resolution":{"observed_at":"2026-05-17T22:30:23.560795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Belgian man dies by suicide following ex- changes with chatbot","venue":null,"work_id":"91553fc0-23af-4d5a-80f4-7d00c62a56f3","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:8660c418bcebcdbf745ffc9fd2ec858c56129611ab4b651134c98ae33373f894","observation_id":"3aae70bb-99d7-440a-8d2f-55425963be5c","resolution":{"observed_at":"2026-05-17T22:30:23.587137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pdid: database of molecular-level puta- tive protein–drug interactions in the structural human pro- teome.Bioinformatics, 32(4):579–586","venue":null,"work_id":"b4353e5f-7816-49ac-89f7-5e3280ec683d","year":2016},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:22db309b134319a58a49c1941e1a4f6792aa3546eba4feea5ac134478d9dd5f6","observation_id":"ce015680-0e26-47a9-b530-9c452d7c4915","resolution":{"observed_at":"2026-05-17T22:30:23.565767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multihateclip: A multilingual benchmark dataset for hateful video detection on youtube and bilibili","venue":null,"work_id":"8cc3246e-856c-4d21-a652-0010d629167e","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:c83b3cc649dce0bdb6918d37c9c5f42986d12c766f1a57c41a727c59b3571d49","observation_id":"f00c0a4e-4693-45ca-84dc-4d9abf9371eb","resolution":{"observed_at":"2026-05-17T22:30:23.589534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cnn-generated images are surprisingly easy to spot","venue":null,"work_id":"2aa367b2-a00c-4cf5-84d8-9ee33d4fe4be","year":2020},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:a202c6fd645a95c937c23041dc63dab009dd07562f445e4a345ccf932303fa84","observation_id":"8946c779-439d-4130-9f71-9b90eae31c70","resolution":{"observed_at":"2026-05-17T22:30:23.584837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal llm enhanced cross- lingual cross-modal retrieval","venue":null,"work_id":"4ae76a3c-e1c4-4b7a-81af-ec3c19df2f58","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:6d27ff7f551269bf1cdaa40cf202c49b2ce9025a59d55f8ad8a94cf345a5e5fb","observation_id":"248c1832-0d7b-43f0-b770-5ed93f46fbc8","resolution":{"observed_at":"2026-05-17T22:30:23.580219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safebench: A benchmarking platform for safety evaluation of autonomous vehicles.Advances in Neural Information Processing Systems, 35:25667–25682","venue":null,"work_id":"c015cee6-3e02-49b7-b41e-685eef626061","year":2022},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:c57e9c5bf3920aa191de3ec58984f8ccd7113399d77dc9658454209c6317d776","observation_id":"5de3b0d0-f0ff-49d9-b094-31d3cb50b857","resolution":{"observed_at":"2026-05-17T22:30:23.554063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models.IEEE Transactions on Pat- tern Analysis and Machine Intelligence","venue":null,"work_id":"8a2ad33e-93df-4793-8c0f-6dd927c7bf4e","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:75f4167d86b1375f311af377cfe6f13c12b81734e4b143b87a182c5d80ea4b9a","observation_id":"37fcecaa-d9bc-4211-ae45-036e9db1a56e","resolution":{"observed_at":"2026-05-17T22:30:23.544701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-08-10T07:22:17.598918Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:d688d7ee179c6291a8f3aed29e8b02dc6dbc9b87932eb628ba18c0849288d895","observation_id":"6fc15024-0c61-4aa2-9ddf-8c353335db91","resolution":{"observed_at":"2026-05-17T22:30:23.197949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lamm: Language-assisted multi- modal instruction-tuning dataset, framework, and bench- mark.Advances in Neural Information Processing Systems, 36:26650–26685","venue":null,"work_id":"f4ee9cfd-8311-44a6-88fb-273ae20090e9","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:714bfb0f7fdb19d7b6738a7434a088911693541c23026b236b349efd4a2f08b7","observation_id":"d8188977-9b7f-41a6-9ba6-45ddc0e9fdd8","resolution":{"observed_at":"2026-05-17T22:30:23.509422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4d7b929c-fe71-4f95-933c-8609889f7519","year":2014},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:e108761078e0705b5dffe0c49584e497cd0f4d76beb702c1d1b17717c9dfbe8e","observation_id":"01baa8ea-d060-4c0f-8009-3b53ebd1fc81","resolution":{"observed_at":"2026-05-17T22:30:23.540294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":"dbfbded1-2560-4389-9085-ffb31c2ab9bb","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:2c5c78a98321952a3dc998d5c86966576ff29836e2dda8cad9d116af73483b1d","observation_id":"6dd6879e-960f-41ff-b8b4-b7032ffe2f96","resolution":{"observed_at":"2026-05-17T22:30:23.533914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exo2ego: Exocentric knowledge guided mllm for egocentric video understanding","venue":null,"work_id":"7bcee111-a638-427a-a4da-1c2e37226464","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:e0bc31f2f07176705e4abd948ab1cbb15f522767dc26cf9956f3323866a31117","observation_id":"d75cc30b-9f41-49de-9bc9-59e7826bc537","resolution":{"observed_at":"2026-05-17T22:30:23.204881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Differential-perceptive and retrieval- augmented mllm for change captioning","venue":null,"work_id":"d93238a5-0140-4c20-95aa-b21d6e91d5b7","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:c935c735559b40c15230a8c43cc3dc79771648cd93ec8443d93d63f2e1dee5c2","observation_id":"f6e31873-1ee6-463e-afd2-a6992fca8476","resolution":{"observed_at":"2026-05-17T22:30:23.529528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multitrust: A comprehensive bench- mark towards trustworthy multimodal large language mod- els.Advances in Neural Information Processing Systems, 37:49279–49383","venue":null,"work_id":"79b3eeae-68f6-4674-a6fe-7d55e6505147","year":2024},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:73ce2ba0778c5eefc1b28131f8e1ec7fe7992f43c5e1f51bac6ca6df4c036896","observation_id":"7a598fdc-efba-4daa-b5c0-c15f8c30046e","resolution":{"observed_at":"2026-05-17T22:30:23.558564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient motion-aware video mllm","venue":null,"work_id":"048a7bc7-97dc-410e-a342-f0fe12734843","year":2025},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:890e8ab0c9edab5e1b0fa75e8b35e3865952649f38f26c79f25a2feb0b71523a","observation_id":"656485e0-10b7-4be0-9511-396446ca99ff","resolution":{"observed_at":"2026-05-17T22:30:23.549207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623","venue":null,"work_id":"6764b4ec-62a2-4944-a43d-0408312fb79c","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:b5aa8688b17910a43ff076776ea17e34b2e8b6e9caef1b67e391427566562e1e","observation_id":"3cbec8e2-f604-4261-bde9-11cf86bdb1ff","resolution":{"observed_at":"2026-05-17T22:30:23.507179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-based table recognition: data, model, and evaluation","venue":null,"work_id":"c1aed323-beee-4d22-82d9-049608550557","year":2020},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:2e785599e8376b96ead45e4b0145ac51036dfdf615b124ac50425c63f0f63e8d","observation_id":"c955c24a-2855-41f8-ab71-0f3a52fd07ec","resolution":{"observed_at":"2026-05-17T22:30:23.538345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Places: A 10 million image database for scene recognition.IEEE transactions on pattern analysis and machine intelligence, 40(6):1452–1464","venue":null,"work_id":"39c68193-f839-483e-b113-72f5f0eb655e","year":2017},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:610bd1451c097d06df90801428e9638e8cabcd56a435a427bdaaa9a334aeae84","observation_id":"c5303516-bf73-4f80-9788-71367453667c","resolution":{"observed_at":"2026-05-17T22:30:23.563421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:55a00327dbc5559caffe65598d370bb0c4653e44dfa187917cc27a54f70092b7","observation_id":"7f35fc20-bda6-4e44-98d3-5ff8b45fc560","resolution":{"observed_at":"2026-05-17T22:30:23.224376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A detailed break- down of the dataset sources and their corresponding content domains is presented in Table 5","venue":null,"work_id":"f300a2db-ceb2-4f8d-b2bd-7a2d2c76dc10","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:0d248c8876000ec94f0b75edf58d3e0a4668f022e9ea05d404eddf6654620cd2","observation_id":"58a719bb-ecbb-4d06-aa27-1a54607dc3bd","resolution":{"observed_at":"2026-05-17T22:30:23.542613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"role\": \"system","venue":null,"work_id":"dcfe5028-9915-4949-9a5c-48ec506922c4","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:720da0c6e9b269387d8e81a65f2876e86f0931222b474db558c01bfb69778b40","observation_id":"c5d2c4f8-04da-4427-be11-ec53d09776a5","resolution":{"observed_at":"2026-05-17T22:30:23.516163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Privacy and Property","venue":null,"work_id":"3a742ee2-1736-4335-8a96-c649c57600d6","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:7d819bf8e70d418da40d766ccdb7c606dc14e60facc621e99c4f6be802ba578c","observation_id":"585544d9-4b99-40e4-a5da-b8ba850e5650","resolution":{"observed_at":"2026-05-17T22:30:23.513991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This subset covers balanced distributions across nine risk categories and four modalities (text, image, audio and video), with detailed data shown in the table 4","venue":null,"work_id":"17152cae-28b7-4d4c-95b8-a7d9db59465d","year":null},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:9d900f5063ba4d5fa0050ad70c08b42667ed05526f6e509aad848a556eceed06","observation_id":"42037712-91de-47b6-bed5-7e37dfef8bce","resolution":{"observed_at":"2026-05-17T22:30:23.551964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3480.1780","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a3f3859-40dc-4bc7-9571-5643e1ae9c01","year":2019},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:fe8d76f0164bdcfabd1a0c25fc5a8388b3888d49c436b14e634fe36e40951426","observation_id":"b5666f61-8bfa-479a-8826-12c0d12d6b6b","resolution":{"observed_at":"2026-05-17T22:30:23.258567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":2,"verified_exact":23,"verified_fuzzy":52},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 3 inbound Pith citation observations for arXiv:2511.10287."}