{"as_of":"2026-08-15T01:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e883aa39a0d0f870ad144b051ca472a2482aca570a994963e4ca901c7c54ba6","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:29:33.334887Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11543/citation-record","integrity":"/paper/2411.11543/integrity","json":"/paper/2411.11543/citation-record.json","paper":"/paper/2411.11543"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T18:29:33.127861Z","title":"Qwen-vl: A versatile vision-language model for understand- ing, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.127861Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:1697cd357692530c98c6af69d5dc7130dcc7b143721ed82b0ed0a4eb9c873d68","observation_id":"32d9ab13-412e-44e9-91da-95889faf2b66","resolution":{"observed_at":"2026-08-12T18:29:33.127861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.945759Z","title":"Image hijacks: Adversarial images can control generative models at runtime, 2023","venue":null,"work_id":"05122227-488a-4838-8580-f5006ccf19f7","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.133504Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:c3396137e6123af4453b111d1a47e09b55b443fa413d282940c75c84ef7083d1","observation_id":"a0429e9e-e10e-4dc9-b726-c6df87f5c87d","resolution":{"observed_at":"2026-08-12T18:29:33.949694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.933111Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":"73a84c98-9835-46ef-a2b4-b22f2dbb74ac","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.137541Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:f88b0eea4265be34a369383ca308d725d911afe42f74923b8595a55fe83b9e7a","observation_id":"a6b154bb-a044-4e52-9bdb-6e121b68aaf8","resolution":{"observed_at":"2026-08-12T18:29:33.937976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.920947Z","title":"Image safeguarding: Reasoning with conditional vision language model and obfuscating unsafe content counterfactually, 2024","venue":null,"work_id":"829e13dd-7eb2-4bb5-8ac7-444acea9ae89","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.141955Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:c7987f4bc271307ff100dc82913698e0158a4c7e5c38b0fc1121df1a0713f3ad","observation_id":"fc67f042-bb33-46d2-ba9f-4abd0af7faf9","resolution":{"observed_at":"2026-08-12T18:29:33.925201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.909378Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"6045e002-d150-4121-89b6-07d69f38a4a4","year":null},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.146610Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:01e5d310979731e8683c1ac8dac85c182cd7b9f8ba73b3dbfa38ba62b1b09263","observation_id":"23467f4c-1b7a-44f7-b46d-b0f62c61e11d","resolution":{"observed_at":"2026-08-12T18:29:33.913698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.897706Z","title":"Antifakeprompt: Prompt-tuned vision-language models are fake image detectors, 2023","venue":null,"work_id":"f24278e5-77e7-4b5f-aab5-4b1f72c98074","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.150340Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:44426b6897b2f7446eef36d38af5bcec36afde03a366d366c9a5ceae205d03ef","observation_id":"72440e1a-9935-4c87-8042-b190e1378edd","resolution":{"observed_at":"2026-08-12T18:29:33.901712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T18:29:33.154314Z","title":"Sharegpt4v: Im- proving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.154314Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:7506115f92d49dd82e56e5bf1efa03d386ea54a3994d6090d0b154ae521632f9","observation_id":"384f5638-c27c-4d99-804d-2d910caefcd1","resolution":{"observed_at":"2026-08-12T18:29:33.154314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T18:29:33.159094Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.159094Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:22c78aa2dfedb443224e47559984e79cf7028f4e1ac95c3a284d170b47ca927a","observation_id":"516ed2bc-7c04-4040-93ae-a7438301a33a","resolution":{"observed_at":"2026-08-12T18:29:33.159094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.885184Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"a91605a7-115d-4ebc-82d3-d6457361511d","year":2021},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.163265Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:aae5c27c7ff2be62512ac8916030d1c823ea98f5fd34137707929cd208a3de5c","observation_id":"4db07976-ba95-4c85-bf39-62f6d1e6375e","resolution":{"observed_at":"2026-08-12T18:29:33.889327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-12T18:29:33.168107Z","title":"Internlm- xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.168107Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:ac1701266ec60ff0236bcdc061fa5eb1a4640245eff5d0ebe01af1ccbbdbaa96","observation_id":"8c68a258-628a-404e-9980-cc0ac6a8e8af","resolution":{"observed_at":"2026-08-12T18:29:33.168107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.872234Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":"dca89537-2936-4ee7-891b-74f195b93cbf","year":2022},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.173070Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:5ea23e58c1ee73c97264ff92aba9652e4d758f046c1489522d5f3ac3f2687c33","observation_id":"82475f71-b3da-4f34-8dd4-0b3969378aae","resolution":{"observed_at":"2026-08-12T18:29:33.876353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.860294Z","title":"Mme: A comprehen- sive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"d21528db-2568-468f-b856-1bee3b2d3b44","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.176842Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:2858ab3c11f6377847770fdb078b8a85b5eaf9f9d29ec6283d6be489d2248ac5","observation_id":"9fbfbe23-38ba-4fc4-b04b-bd5d62b480c1","resolution":{"observed_at":"2026-08-12T18:29:33.864604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.849193Z","title":"Inducing high energy-latency of large vision-language models with verbose images, 2024","venue":null,"work_id":"0f0976b4-701b-4294-94d3-897a18c7b65c","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.179990Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:54eea2f01f62b2405af56dbc417b81da3171f5f5f8235354b2cfd41a3f1c19c0","observation_id":"9f88201e-ac5f-4c0a-9473-c8ed226d9a55","resolution":{"observed_at":"2026-08-12T18:29:33.853154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.835972Z","title":"Fig- step: Jailbreaking large vision-language models via typo- graphic visual prompts, 2023","venue":null,"work_id":"5385fa1e-5aa3-48aa-b28c-ed498be81a9b","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.183160Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:21c6a2a321a2ed1901de1f2c281e41d61ca7934aab4f9e43a6fe0dcb6ac9e0c5","observation_id":"54304045-3415-40dd-a318-4255ee4feecb","resolution":{"observed_at":"2026-08-12T18:29:33.840982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-13T05:08:29.655523Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-12T18:29:33.186515Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.186515Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:ab139c45280b647d4f7a90bba1a55b609942bc2231a84ba5e4c2b9cdfe331eaf","observation_id":"aea55f20-49c2-4dca-bc3c-7819b1cb748c","resolution":{"observed_at":"2026-08-12T18:29:33.186515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.823280Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"1f07dcbd-1119-49a7-9bf6-94304c7d96ea","year":2021},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.191274Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:90a07dbd6730b5a4f7d7b48c79fab4d5640052b23958a758204b35bcc0d6e024","observation_id":"4158e1b0-d3f4-484f-a553-a10d97d131ab","resolution":{"observed_at":"2026-08-12T18:29:33.828033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.811525Z","title":"Nsfw data scraper","venue":null,"work_id":"9cbf1ace-797b-4acb-803f-1972a2de4480","year":2021},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.195499Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:a381f992f5e6a27fd46fe40fd1412d59cae537ccb128cadde305d623419756dc","observation_id":"e8917f62-199c-4d5e-a97b-0054c61feb2a","resolution":{"observed_at":"2026-08-12T18:29:33.815309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.798396Z","title":"Concept bottleneck models","venue":null,"work_id":"66911798-4daa-4c15-bf2c-64a2ea77d3fb","year":2020},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.200222Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:5201d2f229535482cfc68f2c77bb1d40f6a304ac1594e1721fe9446fd6bb388f","observation_id":"b48f14e9-1907-4d64-80d8-83f050a9d852","resolution":{"observed_at":"2026-08-12T18:29:33.803049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.783106Z","title":"A hierarchical approach for generating descriptive image paragraphs, 2017","venue":null,"work_id":"aa695237-5642-425b-bbc9-1c053f6d346c","year":2017},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.204955Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:b2cf183cc4a4a9c9f79ee3a585e4b3e7882d152d86b22a174c017aa3e64b413d","observation_id":"36d6e535-6381-4184-9ed1-bbba99defa90","resolution":{"observed_at":"2026-08-12T18:29:33.790177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-13T05:15:43.956937Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-12T18:29:33.209278Z","title":"Seed-bench-2: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.209278Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:da3165a8f62dd6c084a6f7b40e8129c25a7471083b3c6ff9a1a0f4bc89a2010d","observation_id":"d651c935-b420-4915-a41c-e90ce28adeed","resolution":{"observed_at":"2026-08-12T18:29:33.209278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T18:29:33.214041Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.214041Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:87c52b355a42e3e05a884c76b33a1457e7e485e4d62db4cdfa12436ce0a9b521","observation_id":"7da9cca8-247f-47a5-807c-394543fc7752","resolution":{"observed_at":"2026-08-12T18:29:33.214041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.218280Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.218280Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:9c8ffe0ed500cec51be3d82f78ad5c6c1c79c04eef42f44321c83af98a3cddbe","observation_id":"1af47637-f9f6-44a6-b7f7-cbc4b68ff7dd","resolution":{"observed_at":"2026-08-12T18:29:33.218280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.223174Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.223174Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:c5ee836c65e09dffc282239c241af0ee725d8a89706b7a472e24f0b98c1db22e","observation_id":"6f1abdc0-db2c-47be-aa7d-21d262855cdd","resolution":{"observed_at":"2026-08-12T18:29:33.223174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.754738Z","title":"Red teaming visual language models, 2024","venue":null,"work_id":"06f72e46-2ec4-46d7-9b35-45a5dcc43e16","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.227195Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:a861f8bd93daa1ecbd31c5fd7419730cd4181471222287873a91c71627a6f3d3","observation_id":"ddd21dca-9a6a-47fb-9811-88397de0f38f","resolution":{"observed_at":"2026-08-12T18:29:33.759080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.742819Z","title":"Vl-trojan: Mul- timodal instruction backdoor attacks against autoregressive visual language models, 2024","venue":null,"work_id":"234f7e72-ecfb-4c5b-a255-5c30af7e6750","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.231094Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:46c48f2b624efc078d9e9af33da5ebfd2e006662618f3b72ec998f4774bde23e","observation_id":"2b5a6728-d3b1-4891-b394-d0747968a253","resolution":{"observed_at":"2026-08-12T18:29:33.746772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.236310Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.236310Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:ae4905bf061eed36bf50dbfac332d2bd2fb7b2caaefaa764fe2dea5e2cb79ed6","observation_id":"cb154169-5e40-4037-86cf-df5d4bb7bc15","resolution":{"observed_at":"2026-08-12T18:29:33.236310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.721820Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"09229a71-ca64-43a2-86a6-bbbc127b26b4","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.240512Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:e4e5f4ef6d41dbed3b82e8dcc5fd069494f4bfb6939f1419813afac7b9e06bdf","observation_id":"d2f33554-7af2-4bb3-9c76-b3567be80bfe","resolution":{"observed_at":"2026-08-12T18:29:33.726907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.709307Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"52e4d2a6-ced0-46dc-b59d-b7870e330b8b","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.244894Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:a1493c702e98866c9f57dd53dc3e94dee4f8dc812e2a01667505c22ba35b79d4","observation_id":"e7d6b7e4-f1e5-4632-ad78-443b1bf4867a","resolution":{"observed_at":"2026-08-12T18:29:33.713400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.249485Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.249485Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:754dcfa7b5c0be9dbd21b2ff471e22f2ad08915af1bd53ce9b15eb074776fa9d","observation_id":"07a51b75-5fc9-4e81-97af-1374d39169f6","resolution":{"observed_at":"2026-08-12T18:29:33.249485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.253243Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.253243Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:d2c82127edca85472b4fc2b443ceba01ca270a71c0ff3f0483f254760920413a","observation_id":"7eeea764-5569-42c9-96b9-9964801e3ba9","resolution":{"observed_at":"2026-08-12T18:29:33.253243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.680785Z","title":"Mm-safetybench: A benchmark for safety evaluation of multimodal large language models, 2024","venue":null,"work_id":"492ad16f-8d40-4280-bb00-5172163672eb","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.256901Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:9fcabf8b9cb49264a62f66bfcc63c58f2a4442602b5a52cb58f34bcc885919bf","observation_id":"4a749d1e-df2a-4729-8ad2-43143ac3e85e","resolution":{"observed_at":"2026-08-12T18:29:33.686040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.667436Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2023","venue":null,"work_id":"fe25e7e3-eaf9-4e90-ae92-27170e58e577","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.260390Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:3dc181a842c0de7fe699509f20a12f1eafab318344f402dbb283c156bf497af7","observation_id":"21b551e1-6c26-4d88-b361-fa71c5e1742b","resolution":{"observed_at":"2026-08-12T18:29:33.672265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.654634Z","title":"Deep learning face attributes in the wild, 2015","venue":null,"work_id":"7bd75bee-a4fc-4b96-a0a7-3f4b49f97886","year":2015},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.264015Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:bcc433fed559fe982c64c00c47825390484affdc16c4c9e9718dc522714ba08a","observation_id":"745a8f39-1d37-4cc8-a75d-73379872db57","resolution":{"observed_at":"2026-08-12T18:29:33.658621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10882","last_updated":"2019-07-28T11:40:03Z","snapshot_observed_at":"2026-08-12T17:06:58.436617Z","submitted_at":"2019-07-25T07:53:00Z","title":"Interpretability Beyond Classification Output: Semantic Bottleneck Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10882","snapshot_observed_at":"2026-08-12T18:29:33.267678Z","title":"Interpretability beyond classification output: Semantic bottleneck networks","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.267678Z"},"links":{"cited_paper":"/paper/1907.10882","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:9d7509214e62d463932431d77cff0211d65727df1c661074f51fb4c670b6f8a3","observation_id":"18ad0113-9428-4918-bb47-c6671d5f068a","resolution":{"observed_at":"2026-08-12T18:29:33.267678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.642229Z","title":"Stable bias: Evaluating societal representa- tions in diffusion models","venue":null,"work_id":"80e79e6b-1834-4cd2-8280-a65c78d4e819","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.271764Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:b9779c58f100445d3b018f5bcf049cc0fa54f4c23efa0b7d060582105594ebda","observation_id":"83cd5ba9-4f87-48a2-8902-e80d08d2aa05","resolution":{"observed_at":"2026-08-12T18:29:33.646418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.275572Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.275572Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:f7a77c1057a6282824ad75a595f55c6f737b250545b09656ac1b7c20615c5f21","observation_id":"7b50ee66-87f1-4bc2-918a-81570f5edf0c","resolution":{"observed_at":"2026-08-12T18:29:33.275572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.623094Z","title":"llama3-vision-alpha","venue":null,"work_id":"70d8b80c-7716-47ec-acab-478aae19c62a","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.279385Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:f5ec2873880d4a5ee164680fadbc744ccbf94c7d2b2db5df65432fa0abac625d","observation_id":"f7d1738d-f720-400f-9c35-38ef544e26a0","resolution":{"observed_at":"2026-08-12T18:29:33.626757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.282948Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.282948Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:fcefb85e8426a66038eb8802b5bbf63638961828241dc1a3cd7f55820344ba8b","observation_id":"85d538d1-28a7-42c8-99d5-2825c96c3f4f","resolution":{"observed_at":"2026-08-12T18:29:33.282948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-14T04:19:38.572552Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-12T18:29:33.286362Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.286362Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:a0b24b806ec156c67d4e09c1159069a7ba8746dedd027b67ac80498a9f976ed2","observation_id":"1184df5d-0577-4fd7-a415-3f016dd08efd","resolution":{"observed_at":"2026-08-12T18:29:33.286362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.604256Z","title":"How many unicorns are in this image? a safety evaluation benchmark for vision llms, 2023","venue":null,"work_id":"8c5ae5f7-741a-4f24-9223-98b722c1bd09","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.290064Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:fe4861f3254dde151dc2643e9ed7ba046b4915e4a9783c879e68eda05ac7bb91","observation_id":"3989e4ee-c4bd-4600-9925-a68e3db72797","resolution":{"observed_at":"2026-08-12T18:29:33.608038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.591019Z","title":"Towards understanding and detecting cyberbullying in real-world images","venue":null,"work_id":"29f1d5ab-3e3c-42db-b9ba-8024af38bbdd","year":2021},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.293833Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:611d354a832836ecdcfa0c9829f488fa48338aab9e3a40d4ade39e5173950314","observation_id":"ac426aa2-3471-4d53-8eab-6f9773db2503","resolution":{"observed_at":"2026-08-12T18:29:33.596340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.576872Z","title":"Knowledge mining with scene text for fine-grained recognition, 2022","venue":null,"work_id":"4baac9ad-b573-4636-bd5e-2be9ed571271","year":2022},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.297669Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:1683336ba0db9d5358ff99702b2df123d65ff98189c6422d30bebed95c608017","observation_id":"c669f67b-2509-4b8a-b24d-16cda2f2e17a","resolution":{"observed_at":"2026-08-12T18:29:33.582483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.561699Z","title":"Adversarial prompt tuning for vision-language models, 2023","venue":null,"work_id":"fba5852b-80e9-4c23-a863-fe9e87d394aa","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.306703Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:48684d894eb9c3bb6c9c83666a9c625d41d3cd295820b8e501c5d2bf6344137e","observation_id":"e68a4896-fd60-4c66-bc0d-4fb006ef4ea3","resolution":{"observed_at":"2026-08-12T18:29:33.566740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.545619Z","title":"A mutation-based method for multi-modal jailbreaking attack detection, 2023","venue":null,"work_id":"034206f8-5156-4708-b7ef-e416dfed5a82","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.312676Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:22a9312567bbc671277a50ac4e99a8abfe926a787e86a50eeb9147f1b249a18f","observation_id":"9699e6de-3b32-43c8-89e5-9f4e5394b79a","resolution":{"observed_at":"2026-08-12T18:29:33.550558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-13T10:51:54.769118Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-12T18:29:33.316995Z","title":"Meta- transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.316995Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:f0ffd8a14f1cf4f48be29db496bf98b88a012e20354e442bde1c5e003fcddb1c","observation_id":"12984441-25fb-4e15-86b5-f7b0491619dd","resolution":{"observed_at":"2026-08-12T18:29:33.316995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.530454Z","title":"Privacyalert: A dataset for image privacy prediction","venue":null,"work_id":"1ac3bdce-3e89-4e7f-9a09-50029bf81dce","year":null},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.321251Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:fa0a99b5b20f534b6412b014b7c30fe4bbcd4afade90e9ddd560a482b46e7878","observation_id":"eaf18c04-9c75-459b-9f2f-c8cb34a113b7","resolution":{"observed_at":"2026-08-12T18:29:33.536365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.516965Z","title":"On evaluating adversarial robustness of large vision-language models, 2023","venue":null,"work_id":"8a9535ad-4c81-493a-99eb-b48f7fb1de37","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.326565Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:6cc1f687358e1c6b77899b036a77fcf9cc6e2a445a2a1e68d1eb8bfd8beeca0d","observation_id":"bddfeaf5-f538-465d-a979-3561447de2d4","resolution":{"observed_at":"2026-08-12T18:29:33.520984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.502829Z","title":"Manning, Christopher Potts, and Danqi Chen","venue":null,"work_id":"84181dc8-c0d4-4bc1-a2c7-9265b85ef2c3","year":2023},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.330724Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:7d482841db3cfeab865d6fed8741c9df084aace394bffa8bb0c41cf412bb266c","observation_id":"098cacae-68eb-49fe-875d-ea5afa1a7156","resolution":{"observed_at":"2026-08-12T18:29:33.507548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:29:33.489544Z","title":"A\" and \"B","venue":null,"work_id":"cdee9f2e-5c39-4a84-b212-a03a18441b56","year":2024},"citing_paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:29:33.334887Z"},"links":{"citing_paper":"/paper/2411.11543"},"observation_digest":"sha256:6226b5d864b75840641589062128cf8a8c1c55354b2df548ff0a048633c42a35","observation_id":"50236ac9-7aec-4818-a11d-6968cc81379e","resolution":{"observed_at":"2026-08-12T18:29:33.494338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11543","last_updated":"2025-01-13T10:39:04Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T18:21:17.614442Z","submitted_at":"2024-11-18T13:01:57Z","title":"PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2411.11543."}