{"as_of":"2026-08-08T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a53233c8029d57c47e4869c67ac9a0893a5b71cc7d7753759a9da0c121ea2ffc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:45:18.699387Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:36:25.477552Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":"2406.12030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-07-02T01:36:25.477552Z","title":"Spa-vl: A comprehensive safety pref- erence alignment dataset for vision language model","venue":null,"work_id":"f75960de-0970-49b6-9feb-93ce57d4959b","year":2025},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:7f399862725a39b4095ea5e70a8730e2b9458f381a6a6872e44d0f313a486f48","observation_id":"d2e12838-4ccf-49ba-9b17-e5e8a4b62372","resolution":{"observed_at":"2026-05-16T09:16:17.566890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T19:45:18.699387Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:18.699387Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:eb35afd2cb46dd0890aa2c0069309d99c5d5881617f9db0ba5da3ffa658157b6","observation_id":"8d80368f-848e-46e4-ace1-a54ae02b4736","resolution":{"observed_at":"2026-08-07T19:45:18.699387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T15:43:26.196963Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14035","last_updated":"2025-05-20T07:31:17Z","snapshot_observed_at":"2026-08-08T09:24:43.811323Z","submitted_at":"2025-05-20T07:31:17Z","title":"ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:26.196963Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.14035"},"observation_digest":"sha256:98946f2c71e03713090b8b952c4eea6b78f2ab8c79a1f5f53049b7d969ceb74d","observation_id":"83c036a9-1752-4c5d-9d45-0ad72cb60093","resolution":{"observed_at":"2026-08-07T15:43:26.196963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T15:06:33.585160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17144","last_updated":"2025-05-22T07:30:01Z","snapshot_observed_at":"2026-08-08T01:19:59.233622Z","submitted_at":"2025-05-22T07:30:01Z","title":"MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:06:33.585160Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.17144"},"observation_digest":"sha256:3aa4ab51c38c73d9d95f1211ade9d8ca06fb48761d6fb0104614a3407de0311f","observation_id":"4094a705-1493-4f36-8a93-9f18872c12d1","resolution":{"observed_at":"2026-08-07T15:06:33.585160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T14:13:13.206915Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20362","last_updated":"2025-05-26T09:01:46Z","snapshot_observed_at":"2026-08-07T14:05:21.829543Z","submitted_at":"2025-05-26T09:01:46Z","title":"VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:13.206915Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.20362"},"observation_digest":"sha256:d0a4c94ef10ca0eb0a5e5efa64feb0a3839fb7323f62660248a594235494ca51","observation_id":"20f30d17-d06d-43b2-b242-b28127eaadec","resolution":{"observed_at":"2026-08-07T14:13:13.206915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T13:22:02.983754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.983754Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:1aa092bf9980dd9067f33f78431499fedbdfd6276560d8ee6a00a571a3b68c47","observation_id":"66eaf8e9-4a0e-441f-bf8c-28a6b5c608d6","resolution":{"observed_at":"2026-08-07T13:22:02.983754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T14:15:17.144248Z","title":"SPA-VL:A comprehensive safety preference alignment dataset for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:17.144248Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:22a61265611ad544fe53419c722d9a43698030af44a851eae178170428310ba0","observation_id":"3b2999f1-0081-45a8-8d5a-cf96aa11acf1","resolution":{"observed_at":"2026-08-07T14:15:17.144248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T12:37:22.450280Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model.arXiv preprint arXiv:2406.12030,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-08T01:25:52.362186Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.450280Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:1a14f31e271debecbcdb56b3284b9a009d33afb8bba633a46fcf3b1959eb5ce5","observation_id":"1db626b9-2698-4367-afcd-c3ca4ce1ee8d","resolution":{"observed_at":"2026-08-07T12:37:22.450280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T11:55:14.660602Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model.arXiv preprint arXiv:2406.12030, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.660602Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:c45e27e77579488e345df0c3985042484e224299154e25289d46a0a48486cbff","observation_id":"4a5719e8-17ef-4d2f-994f-0806687c0102","resolution":{"observed_at":"2026-08-07T11:55:14.660602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-06T17:45:45.230207Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10016","last_updated":"2025-08-20T07:04:41Z","snapshot_observed_at":"2026-08-08T01:23:32.395394Z","submitted_at":"2025-07-14T07:51:56Z","title":"The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Language Model Agents","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:45:45.230207Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2507.10016"},"observation_digest":"sha256:744bde0d7bb33e6f5aa9779fbee78453d2fc3f8f7674b6ba161c765d638e7855","observation_id":"fa06ee05-0e53-492f-9fb9-e19e77971e5f","resolution":{"observed_at":"2026-08-06T17:45:45.230207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-06T17:21:35.371849Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vi- sion Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-06T17:12:51.246126Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.371849Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:ff43c09361a37ed4748245a64794f1a4f085dd864b726fa4d778a7c31ee0d2a8","observation_id":"ffc2c45d-0465-46fb-a516-7373399e78f1","resolution":{"observed_at":"2026-08-06T17:21:35.371849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-06T14:45:08.721119Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18043","last_updated":"2026-07-10T01:02:09Z","snapshot_observed_at":"2026-08-07T17:22:41.556728Z","submitted_at":"2025-07-24T02:34:13Z","title":"GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T14:45:08.721119Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2507.18043"},"observation_digest":"sha256:a72483c04c822e81a6b52008e636e3c8a311550253ac3071ef562b76801b8d4f","observation_id":"d841a76a-6ab2-4fe8-8b92-cefda9142c5a","resolution":{"observed_at":"2026-08-06T14:45:08.721119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-04T23:11:33.026717Z","title":"SPA-VL: A comprehensive safety preference alignment dataset for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:33.026717Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:8f51fa86be1ce148a7f9f399198636e0e810f911534cb292d0689adda578cd73","observation_id":"08d7f4a5-692d-40ce-a274-cc75b88179e0","resolution":{"observed_at":"2026-08-04T23:11:33.026717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-03T08:15:37.785906Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model, 2025 d","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-03T08:15:07.553014Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":274,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:37.785906Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:366091e2db6c5992e484b96266ac04beea7ee9d4afb070ea1dfee1145200c5f2","observation_id":"f44a7cbb-4b0b-474c-8a1b-1cb1de01c1be","resolution":{"observed_at":"2026-08-03T08:15:37.785906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":"2406.12030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-07-02T01:36:25.477552Z","title":"Spa-vl: A comprehensive safety pref- erence alignment dataset for vision language model","venue":null,"work_id":"f75960de-0970-49b6-9feb-93ce57d4959b","year":2025},"citing_paper":{"arxiv_id":"2604.19016","last_updated":"2026-04-21T03:06:50Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T03:06:50Z","title":"AlignCultura: Towards Culturally Aligned Large Language Models?","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-10T02:36:36.854805Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2604.19016"},"observation_digest":"sha256:9b3daa42053489e3a16715bbf5e2c12580edeb2ef036528fdfaec3f7a868f159","observation_id":"f5b84ebe-d63f-4aa0-bb8f-2e68e31372cd","resolution":{"observed_at":"2026-05-11T12:56:04.792001Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":"2406.12030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-07-02T01:36:25.477552Z","title":"Spa-vl: A comprehensive safety pref- erence alignment dataset for vision language model","venue":null,"work_id":"f75960de-0970-49b6-9feb-93ce57d4959b","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:6a1baa1920fb5b362a5d354c7bbb97cecb8170109c132f53b231f905af889d47","observation_id":"8368717a-f511-4aad-8797-1c82f474b182","resolution":{"observed_at":"2026-06-29T23:04:02.050551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":"2406.12030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-07-02T01:36:25.477552Z","title":"Spa-vl: A comprehensive safety pref- erence alignment dataset for vision language model","venue":null,"work_id":"f75960de-0970-49b6-9feb-93ce57d4959b","year":2025},"citing_paper":{"arxiv_id":"2606.03089","last_updated":"2026-06-16T07:22:07Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:17:56Z","title":"Constitutional On-Policy Safe Distillation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T11:47:14.135793Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2606.03089"},"observation_digest":"sha256:641ab40874b94aefc8b95b66f5678ca09b2651958d6c4412e4af82df4c7ac91e","observation_id":"5b865bbb-0aaa-4bac-875f-a138a188ffb2","resolution":{"observed_at":"2026-07-02T01:36:25.479676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model.arXiv preprint arXiv:2406.12030, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-02T02:14:15.956064Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:c91b08cac3060fd0616368ca9da2c086b2140001ce35600e045aa97e48cf8ea2","observation_id":"b2e385e7-cee5-4c69-be4b-fe72760b647b","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-01T07:36:57.727029Z","title":"arXiv preprint arXiv:2406.12030","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21401","last_updated":"2026-07-23T15:02:24Z","snapshot_observed_at":"2026-08-04T03:07:11.235926Z","submitted_at":"2026-07-23T15:02:24Z","title":"When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T07:36:57.727029Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2607.21401"},"observation_digest":"sha256:c080e5a9a5e3cdafc4b860b83efd746521fbfd84459369b030c6ab52fbb09acd","observation_id":"f1f5fb41-b8fa-4e59-8cf2-210c92a0e195","resolution":{"observed_at":"2026-08-01T07:36:57.727029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.12030/citation-record","integrity":"/paper/2406.12030/integrity","json":"/paper/2406.12030/citation-record.json","paper":"/paper/2406.12030"},"outbound":[],"paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2406.12030."}