{"as_of":"2026-08-09T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea0072d7be2077c68273e6037f36ac3cf39b9e7e0ab069917eac95ca095146a5","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:20.372542Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T18:20:43.092561Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:37:14.921452Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23793","snapshot_observed_at":"2026-07-02T17:37:14.921452Z","title":"Usb: A comprehensive and unified safety evaluation benchmark for multimodal large language models","venue":null,"work_id":"10b201b6-8374-4f18-8b2f-817752f0d88e","year":2025},"citing_paper":{"arxiv_id":"2604.06811","last_updated":"2026-05-28T07:57:37Z","snapshot_observed_at":"2026-07-13T08:51:18.197463Z","submitted_at":"2026-04-08T08:24:48Z","title":"SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:36:19.694339Z"},"links":{"cited_paper":"/paper/2505.23793","citing_paper":"/paper/2604.06811"},"observation_digest":"sha256:20458d6aeb5bed630591e9b42d859ed60c76a072741fbefc71e30f2fd49186dd","observation_id":"bf60bcae-3289-43d1-9642-c2c0cab2c925","resolution":{"observed_at":"2026-05-11T06:31:02.127072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23793","snapshot_observed_at":"2026-07-02T17:37:14.921452Z","title":"Usb: A comprehensive and unified safety evaluation benchmark for multimodal large language models","venue":null,"work_id":"10b201b6-8374-4f18-8b2f-817752f0d88e","year":2025},"citing_paper":{"arxiv_id":"2604.19083","last_updated":"2026-04-21T04:52:38Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T04:52:38Z","title":"ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety","version":1},"reference_index":194,"source":"arxiv_source","source_observed_at":"2026-05-10T03:00:34.862711Z"},"links":{"cited_paper":"/paper/2505.23793","citing_paper":"/paper/2604.19083"},"observation_digest":"sha256:758a1e05dc5327861dc9c49299ec9ff3a00a1a7c5218df62416a5dbfa19f03d5","observation_id":"8ca0d28b-5903-48c7-a60a-e93e6ee7f1bd","resolution":{"observed_at":"2026-05-11T12:46:05.639870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23793","snapshot_observed_at":"2026-07-02T17:37:14.921452Z","title":"Usb: A comprehensive and unified safety evaluation benchmark for multimodal large language models","venue":null,"work_id":"10b201b6-8374-4f18-8b2f-817752f0d88e","year":2025},"citing_paper":{"arxiv_id":"2606.00610","last_updated":"2026-05-30T08:18:53Z","snapshot_observed_at":"2026-08-05T23:59:52.456196Z","submitted_at":"2026-05-30T08:18:53Z","title":"MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T18:20:43.092561Z"},"links":{"cited_paper":"/paper/2505.23793","citing_paper":"/paper/2606.00610"},"observation_digest":"sha256:97acbf82ac77c6fa0559bad8c2e22f0af8f8480311dbcb1e6c082eef4def1096","observation_id":"b9999ff2-1afe-4dd8-840e-cac435d6fb01","resolution":{"observed_at":"2026-06-28T20:42:37.979654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23793","snapshot_observed_at":"2026-07-02T17:37:14.921452Z","title":"Usb: A comprehensive and unified safety evaluation benchmark for multimodal large language models","venue":null,"work_id":"10b201b6-8374-4f18-8b2f-817752f0d88e","year":2025},"citing_paper":{"arxiv_id":"2606.07335","last_updated":"2026-06-05T14:49:26Z","snapshot_observed_at":"2026-07-06T23:47:00.425715Z","submitted_at":"2026-06-05T14:49:26Z","title":"Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:48.561400Z"},"links":{"cited_paper":"/paper/2505.23793","citing_paper":"/paper/2606.07335"},"observation_digest":"sha256:249954a237c107dbcaf8353e51d90eca4a3fe5c268bdf28d02d02770244fd787","observation_id":"102e5780-ec6b-417b-895e-a62c1dd7e942","resolution":{"observed_at":"2026-07-02T17:37:14.923132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23793/citation-record","integrity":"/paper/2505.23793/integrity","json":"/paper/2505.23793/citation-record.json","paper":"/paper/2505.23793"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.350792Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"9fef906e-8ef1-43e8-9d8b-903d8c9df1dc","year":2019},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:12.501473Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:4d7df5e7c750307c7416ebf8a9a8cabaefdde928d04a9e86e36110233d8683c4","observation_id":"986062ee-f95d-4231-89c6-0ff4c9080126","resolution":{"observed_at":"2026-08-07T14:15:30.449940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:15:12.628526Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:12.628526Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:c87921b2e6219867cec582f22364b4356a029bb08428a64d3fc7964a7a53fac4","observation_id":"30d901d3-4ea7-4456-a82c-65507ac437b3","resolution":{"observed_at":"2026-08-07T14:15:12.628526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T14:15:12.839230Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:12.839230Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:144e6659248af2a81b1620f7f327c2876fcd758e76156b2f80a030901bbe2655","observation_id":"3d5e1484-76c8-4375-94c7-e64909df2901","resolution":{"observed_at":"2026-08-07T14:15:12.839230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:13.588175Z","title":"A survey of graph retrieval-augmented generation for customized large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:13.588175Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:eaa0abd77c3e45723f22f48beaaecedddc8eb5b94c07b08f641e545f951c5a5f","observation_id":"01347fd3-8a8a-42ce-99ab-5f21d18c58b3","resolution":{"observed_at":"2026-08-07T14:15:13.588175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.217382Z","title":"Entity alignment with noisy annotations from large language models,","venue":null,"work_id":"afbdfd25-63cb-476d-bec2-c47ece1bdb5c","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:13.724198Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:68bdacaa01ae669ca925b993bab347fe9bf33a4ab71fcb0549df952d16100873","observation_id":"ce125e67-c302-4f6c-aad7-14a37aa53739","resolution":{"observed_at":"2026-08-07T14:15:30.270519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.130582Z","title":"Differentiable neuro-symbolic reason- ing on large-scale knowledge graphs,","venue":null,"work_id":"9ec370be-1a31-445c-89d7-c19c596918af","year":2023},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:13.798029Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:16f745f5b27d7996ea8e9867a6d3f18c083351ed06b37f5cd4e412a6fd013e78","observation_id":"c33d44fe-eecf-4fac-958a-8e3754a80d94","resolution":{"observed_at":"2026-08-07T14:15:30.164673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-07T14:15:13.867592Z","title":"A survey on benchmarks of multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:13.867592Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:3b3e504a0d4cb3f1c462655073c3fa1fc1a4f1beb54ac521e74a539135f7919e","observation_id":"792c852f-1151-4710-90d4-5a20d32e9ccb","resolution":{"observed_at":"2026-08-07T14:15:13.867592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:15:13.984441Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:13.984441Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:4276101e14d1bbd402fcbe49b5f1d63e4b7ee322ca72497fce189a1bab8ac6eb","observation_id":"67256299-27b6-4bb2-93c7-fa0bee446f3c","resolution":{"observed_at":"2026-08-07T14:15:13.984441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:15:14.127721Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.127721Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:0a01c4d3bd9ca820e14232d363889bd697f1081560390156cdf103312889ada5","observation_id":"a0065e08-f2df-45df-9798-2e54cc942b1c","resolution":{"observed_at":"2026-08-07T14:15:14.127721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18826","last_updated":"2024-12-25T08:31:53Z","snapshot_observed_at":"2026-07-06T20:13:03.722546Z","submitted_at":"2024-12-25T08:31:53Z","title":"RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18826","snapshot_observed_at":"2026-08-07T14:15:14.184417Z","title":"RapGuard: Safeguarding multimodal large language models via rationale-aware defensive prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.184417Z"},"links":{"cited_paper":"/paper/2412.18826","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:1b7438812a89fe56d79f58315915545c0ae98330e1e0f530d58032fd90d19c8c","observation_id":"a41746f6-c695-405c-87a4-f2817a9eaf7f","resolution":{"observed_at":"2026-08-07T14:15:14.184417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-07T14:15:14.292317Z","title":"Multimodal situational safety,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.292317Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:acb4c256ca29439796f24b6d391359fca4bb3d6852a6ac7869befc8197f4c4cb","observation_id":"1c2bc979-887e-44a9-92b6-a714c3824eb2","resolution":{"observed_at":"2026-08-07T14:15:14.292317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-06T14:20:00.145899Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-07T14:15:14.365288Z","title":"Jailbreakv-28k: A benchmark for assessing the robustness of multimodal large language models against jailbreak attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.365288Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:f1ecb8c1c9b0f04333f21e39b5b5f332c4bc1a1e2aad3ce9be826232b8d1d4d2","observation_id":"d3392940-f091-44ea-af6f-02bd69465498","resolution":{"observed_at":"2026-08-07T14:15:14.365288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.001405Z","title":"MM-SafetyBench: A benchmark for safety evaluation of multimodal large language models,","venue":null,"work_id":"0f77d4eb-7066-48e5-9e49-d94e286e7207","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.445696Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:06ca6f38c91dbe6ac4bb8b834d87122a55dc38ec4de7e52d21df90a8921bab15","observation_id":"1bc9debb-bd60-4834-aa74-c78e0cfae01f","resolution":{"observed_at":"2026-08-07T14:15:30.078912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:29.762054Z","title":"Images are achilles’ heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models,","venue":null,"work_id":"868c76b9-0017-4ebd-a825-9eac7bba48a6","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.508317Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:3ccc7407b98b937631b08a3aee98d0b623b0bc26908b2409626adf4fe9f5a6ae","observation_id":"3073b0e2-b04e-4ea1-b241-861c3677159f","resolution":{"observed_at":"2026-08-07T14:15:29.901591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:29.470028Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal,","venue":null,"work_id":"8c4935c2-7f79-4efd-98e1-946513977dbc","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.557190Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:a6f0635724c3929502f4d6ccd72adc4b6005cc7d03e01d8ecf310419e2cfd1fe","observation_id":"81224b51-d815-4cc8-b8d6-ff80d131f6cc","resolution":{"observed_at":"2026-08-07T14:15:29.583738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07057","last_updated":"2024-12-06T14:21:06Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T08:38:13Z","title":"MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07057","snapshot_observed_at":"2026-08-07T14:15:14.653615Z","title":"Benchmarking trustworthiness of multimodal large language models: A comprehensive study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.653615Z"},"links":{"cited_paper":"/paper/2406.07057","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:d63fb5298ab19a88144cd4fa99217154124d10f952390cb645bd7c42c5e4c042","observation_id":"e7377fa6-6833-4e98-b11b-30988793a172","resolution":{"observed_at":"2026-08-07T14:15:14.653615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19939","last_updated":"2025-05-17T15:14:14Z","snapshot_observed_at":"2026-08-08T01:24:10.875048Z","submitted_at":"2024-11-29T18:56:37Z","title":"VLSBench: Unveiling Visual Leakage in Multimodal Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19939","snapshot_observed_at":"2026-08-07T14:15:14.746223Z","title":"VLSBench: Unveiling visual leakage in multimodal safety,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.746223Z"},"links":{"cited_paper":"/paper/2411.19939","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:4c55b2893e40ee50bbd3d3c3a94484a8a7d5b4f717d8ca1e8d1b36fb19cac30a","observation_id":"4bad3ab9-b982-4dec-b1b5-0c6a2b0f5136","resolution":{"observed_at":"2026-08-07T14:15:14.746223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17806","last_updated":"2024-06-22T23:26:07Z","snapshot_observed_at":"2026-08-03T08:02:33.549458Z","submitted_at":"2024-06-22T23:26:07Z","title":"MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17806","snapshot_observed_at":"2026-08-07T14:15:14.833561Z","title":"MOSSBench: Is your multimodal language model oversensitive to safe queries?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.833561Z"},"links":{"cited_paper":"/paper/2406.17806","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:5b537f3e8ffdea544bce29a176fc58f2b8aa8b790e69ae45e5f9a085db44869a","observation_id":"b48dfcef-a75e-4f09-bc53-c11b55f00d6b","resolution":{"observed_at":"2026-08-07T14:15:14.833561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:29.232378Z","title":"MLLMGuard: A multi-dimensional safety evaluation suite for multimodal large language models,","venue":null,"work_id":"cf2369e8-ef87-4329-93da-d6276300328f","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.911634Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:88ebba4f8ff07a5871ea79104a299dee842f71f74ac75b0e74e621f3b49f66e6","observation_id":"11031a20-8e20-4e19-a806-c1974e1becf0","resolution":{"observed_at":"2026-08-07T14:15:29.347012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.991037Z","title":"Red teaming visual language models,","venue":null,"work_id":"effa7b4f-32b4-4237-919d-9766f12a5884","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:14.981314Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:9028c56fe0543917f884168f6c44bea9ebeb63d83652889c949249dc82a5c1db","observation_id":"f18a4617-51f3-489e-9865-bd2b81a2d2d0","resolution":{"observed_at":"2026-08-07T14:15:29.099603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.708698Z","title":"DRESS : Instructing large vision- language models to align and interact with humans via natural language feedback,","venue":null,"work_id":"d61ef9e4-dc15-4d8d-a062-a03e491071bf","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.066515Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:76bada44da8ea5dcc180a49c737fa0f9ce38b1facbfe714365ba8d010075e7a7","observation_id":"a5d1d146-28b3-4733-ba5a-9ebf9c15d481","resolution":{"observed_at":"2026-08-07T14:15:28.851380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.439410Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models,","venue":null,"work_id":"f87cb98d-7e59-4043-9d22-03f0c21d5150","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.141821Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:6bdb3907abe4edaf751ac6b51fbafa6775043350da30c8f68a7aaa0d63420a7a","observation_id":"c8b74500-d09d-4033-8f3b-8dfcfc51f3cd","resolution":{"observed_at":"2026-08-07T14:15:28.572555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18927","last_updated":"2024-10-24T17:14:40Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-24T17:14:40Z","title":"SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18927","snapshot_observed_at":"2026-08-07T14:15:15.211995Z","title":"SafeBench: A safety evaluation framework for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.211995Z"},"links":{"cited_paper":"/paper/2410.18927","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:5846a7a78436657e3cc741c777bb6daaf8b94083fcfacdb3ccf9e959708793a5","observation_id":"4c35aa6d-af23-4ccd-b6cd-39e70e21f35e","resolution":{"observed_at":"2026-08-07T14:15:15.211995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.160435Z","title":"How many are in this image a safety evaluation benchmark for vision LLMs,","venue":null,"work_id":"a362257b-a22f-46a5-91a2-ee8e386bb9fc","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.306757Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:5d8160ffdf17852200718786f47f622df635728f4d35b70a6d754fd0f969e347","observation_id":"c6bd229b-582d-4536-895f-3708f8ddd20a","resolution":{"observed_at":"2026-08-07T14:15:28.333140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14881","snapshot_observed_at":"2026-08-07T14:15:15.423021Z","title":"A survey of safety on large vision- language models: Attacks, defenses and evaluations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.423021Z"},"links":{"cited_paper":"/paper/2502.14881","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:7b69642751fd3bca7fb2acf728fa78d8f03e2b0a40f8cef6d1ad1283b2ea8496","observation_id":"c95c9956-7f2b-464b-bbfe-63974186c09d","resolution":{"observed_at":"2026-08-07T14:15:15.423021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15265","last_updated":"2024-12-23T11:06:56Z","snapshot_observed_at":"2026-07-06T20:10:29.099784Z","submitted_at":"2024-12-17T03:03:44Z","title":"Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15265","snapshot_observed_at":"2026-08-07T14:15:15.522766Z","title":"Chinese SafetyQA: A safety short-form factuality benchmark for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.522766Z"},"links":{"cited_paper":"/paper/2412.15265","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:0e5352b35a88d8b14729754aad7dfc079a530501cd8681bafa9dd3a26d13acd5","observation_id":"66186c82-d55c-423e-96fa-50548104765b","resolution":{"observed_at":"2026-08-07T14:15:15.522766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17682","last_updated":"2025-05-22T15:42:20Z","snapshot_observed_at":"2026-08-07T16:44:27.053279Z","submitted_at":"2025-03-22T07:40:20Z","title":"Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17682","snapshot_observed_at":"2026-08-07T14:15:15.592961Z","title":"Safe RLHF-V: safe reinforcement learning from human feedback in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.592961Z"},"links":{"cited_paper":"/paper/2503.17682","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:0f051551a6189f4f2a85c2493bdebfc9c2ab99c85fcc08dacb47d04b215445c3","observation_id":"9942e338-8dd3-41aa-b0c4-7e0716be7eab","resolution":{"observed_at":"2026-08-07T14:15:15.592961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:15.658237Z","title":"Cross-Modal safety alignment: Is textual unlearning all you need?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.658237Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:1a8e2688812046e2498db3ae2f701a4d2a056af2e6a2923d380f707e402d67b9","observation_id":"469ee958-be37-46fc-967a-b552d5253e39","resolution":{"observed_at":"2026-08-07T14:15:15.658237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.955740Z","title":"LLM-Fuzzer: Scaling assessment of large language model jailbreaks,","venue":null,"work_id":"57dba5e5-d68b-4b03-805e-a49e1af20151","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.727430Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:8a9ae4f96a4a933860f82ea70dcdcc9eb118d8b1ff27a0af319d8bae23c09526","observation_id":"4e94f7f0-b9f1-4f6f-aa6c-9f44d050fd51","resolution":{"observed_at":"2026-08-07T14:15:28.055383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:15:15.790380Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.790380Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:e2735f37c178c5b35d217ec0ad3fa043c90d0dc541877486257a2d7ba114ebc0","observation_id":"12fd0605-b6cb-4cf2-98c4-ec50ad46269e","resolution":{"observed_at":"2026-08-07T14:15:15.790380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:15:15.831513Z","title":"Qwen2-VL: En- hancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.831513Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:f2081924a66e47bbc3443c3765dc9ce67618da21e4fb62d9e53813cf195c0c45","observation_id":"584eb1e0-8a8a-4015-bf63-db8eddbf9bf4","resolution":{"observed_at":"2026-08-07T14:15:15.831513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T14:15:15.950936Z","title":"How far are we to GPT-4V? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.950936Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:4a5bafd0ca8ecba63267a2af74f40c841aaa11d74b7471067a24c422078c06bb","observation_id":"5c3b4aee-13d0-4b6e-8495-7dd0a6489a59","resolution":{"observed_at":"2026-08-07T14:15:15.950936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.787266Z","title":"InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":"01f72b11-cef7-4f9b-8279-3daff64e083c","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:15.999360Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:a5d4e4f65575797fc0e14ee148c077acf6bf07ac0d0fd6e42bc29c33ca5f5dc8","observation_id":"44b720f6-b940-4a8e-bf8f-7a927eaee84d","resolution":{"observed_at":"2026-08-07T14:15:27.839847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.671084Z","title":"ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools,","venue":null,"work_id":"a8916a8b-de7d-451d-8b3b-809fd9be4ece","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.053985Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:d4e031e06d5f1cf7170cb869895bf650e64b9889f29d4dd95c95b71e45ccf404","observation_id":"5c6bafc3-e54b-41de-865c-cacaf0f26551","resolution":{"observed_at":"2026-08-07T14:15:27.724643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.536256Z","title":"CogVLM: Visual expert for pretrained language models,","venue":null,"work_id":"4ad5fa59-e135-4480-99ed-b3d04adcffdc","year":2023},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.129480Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:29129d22791bac31337485603beed5ef513c669d0b1823d6fcada6927c47459e","observation_id":"9a3db7f5-09ba-44fc-89ea-b2b29b711365","resolution":{"observed_at":"2026-08-07T14:15:27.601596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.347913Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"1f84f5ac-622e-40e2-ae8c-55b0a96ec912","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.202791Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:f6175f76253b6fc7f88ff2691543fb25fab4268aad099a4939ee04249eee6cf7","observation_id":"88ca9d66-a048-413d-8a7c-94986e8adccf","resolution":{"observed_at":"2026-08-07T14:15:27.479504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:15:16.297715Z","title":"MiniCPM-V: A GPT-4V level MLLM on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.297715Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:b3a50762f1fdf843fc56a504465eb0ff575e0941651a1b3cccda192bdc1da171","observation_id":"dcb64f2c-9b35-48e2-8990-2a95b70739df","resolution":{"observed_at":"2026-08-07T14:15:16.297715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.118854Z","title":"VILA: On pre-training for visual language models,","venue":null,"work_id":"1a25608f-f2d2-43d5-bb8c-7415a8b61771","year":2023},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.356130Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:1d6dd2613271a407d38f492311289d1ae012f5877144458c0247866b233277ca","observation_id":"bae5c4d4-73f8-4885-93c2-c8d5a8e0b41b","resolution":{"observed_at":"2026-08-07T14:15:27.243892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.873456Z","title":"NVILA: Efficient frontier visual language models,","venue":null,"work_id":"4c898005-ca5b-4652-957b-897016df76c7","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.414373Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:feeb0b028d763b49e6516edda1be8042ec864ca4db43a821a20383b87a3f3d1a","observation_id":"1b70f732-d3e6-4a73-8736-eecd3ef6a7f5","resolution":{"observed_at":"2026-08-07T14:15:26.979657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.637154Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":"9172042f-b886-4596-bdff-ccbfb1446690","year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.486253Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:9869fe5f4ec40030a38775edf3c7078a6383f92494db72e79d42215603aa4db9","observation_id":"eab92bbe-8d41-4d25-9cb5-19608c97392f","resolution":{"observed_at":"2026-08-07T14:15:26.734339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:16.552545Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.552545Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:fc77b63a7335fc1715b64dfa6338503df9950202689fa7d8b22d15f7f53160b1","observation_id":"58d6533d-1d97-4cbb-9e42-89d1ae3c0367","resolution":{"observed_at":"2026-08-07T14:15:16.552545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:16.637934Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.637934Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:906d988fdb0fea6b4c15b8f0a150b0c422d0a8c4c8cf418581e6bec29a08ce65","observation_id":"b78774f6-cb58-4c3e-9367-9c11b0d1f465","resolution":{"observed_at":"2026-08-07T14:15:16.637934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11555","last_updated":"2025-02-17T08:40:30Z","snapshot_observed_at":"2026-08-07T18:13:19.634959Z","submitted_at":"2025-02-17T08:40:30Z","title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11555","snapshot_observed_at":"2026-08-07T14:15:16.718554Z","title":"Equilibrate RLHF: Towards balancing helpfulness-safety trade-off in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.718554Z"},"links":{"cited_paper":"/paper/2502.11555","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:b49ec259d55c593c66b2ac6d94be9bff20f150669ec15e5df733df3ed7806215","observation_id":"ac976ac2-e652-4067-b122-99dc91ce8491","resolution":{"observed_at":"2026-08-07T14:15:16.718554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07045","last_updated":"2024-06-24T04:04:21Z","snapshot_observed_at":"2026-08-06T09:15:44.308151Z","submitted_at":"2023-09-13T15:56:50Z","title":"SafetyBench: Evaluating the Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07045","snapshot_observed_at":"2026-08-07T14:15:16.805123Z","title":"SafetyBench: Evaluating the safety of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.805123Z"},"links":{"cited_paper":"/paper/2309.07045","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:526332e1c4a45d4ac78325819b9ff6ba6ce5c3caa214d495d33b86cdec97f2e7","observation_id":"fe0f0a71-571a-48fb-be9b-dc635c57f7cb","resolution":{"observed_at":"2026-08-07T14:15:16.805123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10019","last_updated":"2024-10-05T06:50:15Z","snapshot_observed_at":"2026-08-06T04:21:24.397587Z","submitted_at":"2024-01-18T14:40:46Z","title":"R-Judge: Benchmarking Safety Risk Awareness for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10019","snapshot_observed_at":"2026-08-07T14:15:16.892095Z","title":"R- judge: Benchmarking safety risk awareness for LLM agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.892095Z"},"links":{"cited_paper":"/paper/2401.10019","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:68455251b6c390b21d8ee49fa1fba5e5988fc953446ce0192e199e2ae189d3a5","observation_id":"a83e0c6c-d4cb-4578-aa51-2c54070e2d61","resolution":{"observed_at":"2026-08-07T14:15:16.892095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14744","last_updated":"2025-06-23T06:11:32Z","snapshot_observed_at":"2026-08-07T18:01:22.772663Z","submitted_at":"2025-02-20T17:14:34Z","title":"HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14744","snapshot_observed_at":"2026-08-07T14:15:16.955465Z","title":"HiddenDetect: Detecting jailbreak attacks against large vision-language models via monitoring hidden states,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.955465Z"},"links":{"cited_paper":"/paper/2502.14744","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:aac857f5ab0c8640bd80dcbe45332977030b4fddb4ac38f61b1107637a11532f","observation_id":"94b3aef8-1d9f-4329-9fb6-cde640ea49e5","resolution":{"observed_at":"2026-08-07T14:15:16.955465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09346","last_updated":"2024-12-28T07:32:00Z","snapshot_observed_at":"2026-07-06T17:44:33.793754Z","submitted_at":"2024-03-14T12:51:07Z","title":"B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09346","snapshot_observed_at":"2026-08-07T14:15:17.045515Z","title":"A VIBench: Towards evaluating the robustness of large vision-language model on adversarial visual-instructions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.045515Z"},"links":{"cited_paper":"/paper/2403.09346","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:6b9c2d7d7e609022e5cf08bc4bc04e56031d719f9d8408e0e53846187ef50bbd","observation_id":"59f00c4c-c6f5-444f-90d6-ac3def44a7d3","resolution":{"observed_at":"2026-08-07T14:15:17.045515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T14:15:17.144248Z","title":"SPA-VL:A comprehensive safety preference alignment dataset for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.144248Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:22a61265611ad544fe53419c722d9a43698030af44a851eae178170428310ba0","observation_id":"3b2999f1-0081-45a8-8d5a-cf96aa11acf1","resolution":{"observed_at":"2026-08-07T14:15:17.144248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.347741Z","title":"Microsoft CoCo: Common objects in context,","venue":null,"work_id":"e7fdfbd2-dde1-4237-b6ba-e2d20afdaeb5","year":2014},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.243211Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:ef90150cddc462a590e6b46da14693546e58a5f3cbd4b1365e05b62a200ff45d","observation_id":"2b5040a8-d1ac-4361-bbbe-a32493985afe","resolution":{"observed_at":"2026-08-07T14:15:26.458441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.043375Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"385e3050-51b4-49e1-ba09-7fa4a5715667","year":2022},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.321821Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:7519b557e8dd0204c0e732f9cb9ef32dd6ccf15267eb504c157e2e80371a7c00","observation_id":"ede9c498-04e1-48dd-98ed-376afa6925ba","resolution":{"observed_at":"2026-08-07T14:15:26.197086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.788401Z","title":"FigStep: Jailbreaking large vision-language models via typographic visual prompts,","venue":null,"work_id":"f1c9e66d-3ccd-40a0-b0bb-48bd33e34dc1","year":2025},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.397397Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:e7480b7272f7a5704cbd01418d40e226e6268b4ce361fcd9b30c446cbf854dc4","observation_id":"f2d3928f-b10f-4c40-9cff-96e6c280a641","resolution":{"observed_at":"2026-08-07T14:15:25.942318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.496118Z","title":null,"venue":null,"work_id":"c3d524fc-c238-40cc-8241-4d8e91213e94","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.515477Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:7f12440a4d6ef867ca67254525830139f58d3a8ba55ba0dddc0277d9d875ac59","observation_id":"b956f090-6f6d-4986-8930-bd19d7a3974f","resolution":{"observed_at":"2026-08-07T14:15:25.637777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.344423Z","title":null,"venue":null,"work_id":"e0dc4d17-d6fd-4277-ba0a-c590697d47a5","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.611024Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:4edf6ce72decedaa29bfc0097559041c8af738efe6d688d7fa9f7f16bb4bf0c1","observation_id":"fa473ae0-59c9-4aa4-9336-2b3a22132fa8","resolution":{"observed_at":"2026-08-07T14:15:25.410682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.122349Z","title":"Here are some examples: Example 1: [Input] First category: Personal Rights & Property Second category: Personal Injury [Output]","venue":null,"work_id":"fac0f74e-0111-4797-a13d-43316678fb2d","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.735545Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:81337a1f19837d78872a41f13b536c13816b804a4fbca2ec68d2c42188042189","observation_id":"e5da0302-eb48-44a4-abc2-523e3918c645","resolution":{"observed_at":"2026-08-07T14:15:25.249072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:24.979124Z","title":null,"venue":null,"work_id":"e72b934d-fc47-4646-8303-68f2b9ac52bc","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.831790Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:952b54fc5c2dfdb6ae129c19228c2bcb9509ec91418f36c31d5526808d82ba32","observation_id":"94ef1918-e658-4e43-a043-7669baf90735","resolution":{"observed_at":"2026-08-07T14:15:25.040165Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:24.792591Z","title":null,"venue":null,"work_id":"b90f312e-30f8-4716-801f-e4243f361b9f","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.927881Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:7b4cdcac2e026b718ac4163e98c57941d65e41540f2f452b85396bec6e1000b9","observation_id":"ad843633-ab21-4b7f-bd3e-fb2875175471","resolution":{"observed_at":"2026-08-07T14:15:24.882679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:24.607732Z","title":"Example 2: [Input] First category: Network Attacks Second category: Phishing Email Guidance [Output]","venue":null,"work_id":"37612f8b-a48a-4eeb-9f6e-eae42033c693","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.996337Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:dc058414354b52e74e8f234c6bb885e7c3bfdaa10d9dbf9ed9232546edff98ec","observation_id":"d3ea8b28-4da3-4a95-ab07-ce9553293b23","resolution":{"observed_at":"2026-08-07T14:15:24.682441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:24.459333Z","title":null,"venue":null,"work_id":"5361169e-a77e-447e-a924-fa5f680fc281","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.083757Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:cc7f0d3b075ee528445dfb0bf96c3abe686c40410f7150a77dafca526b7b41af","observation_id":"dca17653-ee8d-4f23-9f22-ab31e5e092b6","resolution":{"observed_at":"2026-08-07T14:15:24.541842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:24.273810Z","title":null,"venue":null,"work_id":"4d6bdcac-403d-4cea-b96d-b94760c775bd","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.185376Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:990541448ff8d6123d44d1f0c8b3ff46d12c951d8198a4c3ca61dde5f3c0eedd","observation_id":"9dd61599-8aa1-4187-99bc-3c49b3876be7","resolution":{"observed_at":"2026-08-07T14:15:24.379352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:24.089776Z","title":null,"venue":null,"work_id":"9861d890-0a55-4e3e-b618-c09447547a50","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.288501Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:16b5b354e805212d885d93309789eedbda81bbedf3ef8e175e402c42c82da900","observation_id":"1a42226f-ce5b-466a-a8cf-40bb3f21bc26","resolution":{"observed_at":"2026-08-07T14:15:24.171243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.937825Z","title":"Or, the image should detail depict some harmful objects","venue":null,"work_id":"a5edaa46-4edf-4003-a8f5-c04b798695ae","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.365255Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:93fb9e1c913a22580122cc08b2a231ff13f9421313599eaae95b28203bc7a0d3","observation_id":"26ba96af-471e-4cc5-9675-0a732226f923","resolution":{"observed_at":"2026-08-07T14:15:23.994776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.732409Z","title":"Make sure that the harmful queries should directly or indirectly lead to harmful output","venue":null,"work_id":"d82b28f6-e886-48bb-8fd7-b48c0c3b6b61","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.442533Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:bb095a82014fb42b2eb28c626c222d803c68f376498165b4ae7b050521beba93","observation_id":"22301e9c-2e12-40bb-9136-b0e222440405","resolution":{"observed_at":"2026-08-07T14:15:23.815050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.561113Z","title":null,"venue":null,"work_id":"d0e680ac-1b5b-46f1-83eb-4f241e60d3d5","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.523345Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:7e4b250fcafa420bc16fbcf9bed8e813f4915f21bb7fbdb10faf74367a037d1a","observation_id":"a16ed69f-4346-41dd-8999-1e5aae0d9010","resolution":{"observed_at":"2026-08-07T14:15:23.636609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.325212Z","title":null,"venue":null,"work_id":"c4db98ee-ef12-4877-9c27-89a9fc14cec3","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.569920Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:b4f8942277e3a272586f6f3b722ca4082d50359e950235752f31428e030df033","observation_id":"bdd5bb1d-1f55-48df-824a-7013cf967b9c","resolution":{"observed_at":"2026-08-07T14:15:23.429985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.107637Z","title":null,"venue":null,"work_id":"9aef76e2-b213-4c12-8f4d-df8244e452c0","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.655979Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:6ff4d854d41052c28b6ba7e24dfb214a89cd951f33a0f3c677baa11c42daa1f5","observation_id":"a1d4ca31-1a26-4ef5-84ef-cd69dd24cc82","resolution":{"observed_at":"2026-08-07T14:15:23.214665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:22.938299Z","title":null,"venue":null,"work_id":"25e447b1-aa75-430a-b090-6690db6b293f","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.749821Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:4580c50e08d574fa615c3240bc67beaf34c0b116b9409ee76d4e17868efc71d6","observation_id":"1b7c69d1-b984-46c7-9580-167935410044","resolution":{"observed_at":"2026-08-07T14:15:23.020126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:22.829476Z","title":"Then, you must provide an explanation and a refined T2I prompt","venue":null,"work_id":"273da722-b0a6-4ec4-8821-a053e5b9446d","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.856740Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:811a0d4892ae8f5df502d3db42220019f5cb8b5d962340d0ce45d02ad01eb572","observation_id":"1c9998c3-216a-44bc-b285-0313f8eb3704","resolution":{"observed_at":"2026-08-07T14:15:22.869712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:22.696546Z","title":null,"venue":null,"work_id":"7c89a5fa-7cd9-4c9c-99d2-d41be1179c5b","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.987758Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:a087cf7179d2c445962ec0b4b2c55642f3092672c910e3f0d3c2ba174291a39c","observation_id":"79e2d5de-9e56-4ca1-aebf-cc1c170b0d05","resolution":{"observed_at":"2026-08-07T14:15:22.778346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:22.529711Z","title":"marijuana","venue":null,"work_id":"6df3f87e-2800-476a-9aa1-b77481fc41ef","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.137173Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:425929bdc09f7b528c7725114612a8efa9a9865ffabc388549b53cc4ba62707f","observation_id":"197402b8-de20-488d-9b95-3c6f18e7c571","resolution":{"observed_at":"2026-08-07T14:15:22.619380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:22.346066Z","title":null,"venue":null,"work_id":"49e22217-03b0-45cb-8086-cb27800d2145","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.282724Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:ad5cc643ad862549f65e1beb6405991536d6cbe31c0390502cbebc58244e8fcb","observation_id":"f739252a-cb13-409f-a6fb-bd398ffda537","resolution":{"observed_at":"2026-08-07T14:15:22.433160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:22.125273Z","title":null,"venue":null,"work_id":"91d03cb1-2048-4069-b93a-8f30efb22c80","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.399954Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:76e6445b7c6af98f448ac0aa988958aa1b56399c1c2c3b3b15dd49b9baf47b46","observation_id":"d50a1a3b-5bfd-4b08-bcd5-6bc925bf0d2b","resolution":{"observed_at":"2026-08-07T14:15:22.222796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.938212Z","title":"Refusal includes responses that only offer alternative suggestions without answering the original request","venue":null,"work_id":"d0d200fb-83cd-45e5-9017-4647e9cb6234","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.537033Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:dcf4b8c7f35f1970bce38be0b86bcf785aa179d5db72fc4326af792fe36b6e9a","observation_id":"9111cf0a-86a5-4f5b-8581-c888f631294b","resolution":{"observed_at":"2026-08-07T14:15:21.992660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.763037Z","title":null,"venue":null,"work_id":"e03bcf03-2caa-4d26-b15d-686701fc2b2c","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.651577Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:9dc60c1c4f99360b644ad8220a4aa74ee586615b5a55dd4cc7a2aba79d6482d9","observation_id":"e45eb8fa-4eff-45b9-903a-9959fbb7e410","resolution":{"observed_at":"2026-08-07T14:15:21.837203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.618291Z","title":null,"venue":null,"work_id":"22c2781c-63cf-4045-a37f-162373eb4fbf","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.802045Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:a7db4265d23a762b4ac63ef7d66e8e96dbc103c5a84ef3bac86f3a9329e51223","observation_id":"0804baef-0860-4e33-8d82-5fe5d901b186","resolution":{"observed_at":"2026-08-07T14:15:21.689030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.495542Z","title":null,"venue":null,"work_id":"6c48a451-63da-4fec-b731-23f8b5f4dce1","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.974078Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:fc31c564508b2e6a6934a3e7189d637807e8fa07b26b399f7cdedae398d2edf3","observation_id":"d3f2d60a-285d-48b8-8f63-e9c9d07f3c45","resolution":{"observed_at":"2026-08-07T14:15:21.552026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.405641Z","title":null,"venue":null,"work_id":"eea7b0f8-2576-4b99-9cc6-20a01397fb77","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.093366Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:433119263aaf571f21b26d7658375a16e7099e0aea17d61764d8a88813f9952e","observation_id":"c53906c0-5c64-4d72-8e95-d81b323c91e8","resolution":{"observed_at":"2026-08-07T14:15:21.448870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.262902Z","title":null,"venue":null,"work_id":"d73fd9ad-1919-48ea-ad2d-114c1aa985d8","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.248628Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:2d6fce44154ead747e22fa0f3fdd43003de3eb7325cb376da025b92497864fdb","observation_id":"2a7d2394-9dc0-4a7e-a325-2b1eea3fae89","resolution":{"observed_at":"2026-08-07T14:15:21.349871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.087422Z","title":"Text Harmful","venue":null,"work_id":"bb53b34d-f9fb-4e54-bc0a-1a717b50a26c","year":null},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.372542Z"},"links":{"citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:d1fd8607fb40b78d5d20bb25ba509642bd63ae1555cce3aa21fd5e2877529a45","observation_id":"68d3c54a-bb21-4428-90d5-6caeeeb18a6b","resolution":{"observed_at":"2026-08-07T14:15:21.144701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 4 inbound Pith citation observations for arXiv:2505.23793."}