{"as_of":"2026-08-10T06:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:103b7d203ce370c8948be0b05ae12bac16c85f7c1d588afb86baf7fb00ee1953","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:24:15.097357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:29:39.387246Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2405.13581","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-07-04T07:29:39.387246Z","title":"Safety Alignment for Vision Language Models","venue":null,"work_id":"528605d5-3a66-44b7-ba90-b405f7bb8eee","year":2024},"citing_paper":{"arxiv_id":"2502.01241","last_updated":"2026-04-13T12:56:05Z","snapshot_observed_at":"2026-07-06T20:30:12.663808Z","submitted_at":"2025-02-03T11:02:30Z","title":"Peering Behind the Shield: Guardrail Identification in Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T03:45:14.234545Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2502.01241"},"observation_digest":"sha256:d3a75f8774e6e5154f2734a12eea04a163eeb9e612cb855df55e7030829894f9","observation_id":"7ec507a7-44a4-4815-8e5a-9eb6904ced24","resolution":{"observed_at":"2026-05-23T03:45:21.367881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-07T19:45:18.741577Z","title":"Safety alignment for vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:18.741577Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:5d1d334483e0a4b8e2531777fb14a5bcbde9408a1acae46ed0e07a7e38f709f8","observation_id":"bb5cd8c9-7ef6-47a2-8e7c-088d341d3016","resolution":{"observed_at":"2026-08-07T19:45:18.741577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-07T15:11:04.864541Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16104","last_updated":"2025-07-22T10:32:33Z","snapshot_observed_at":"2026-08-10T04:34:07.930157Z","submitted_at":"2025-05-22T01:06:28Z","title":"Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:11:04.864541Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2505.16104"},"observation_digest":"sha256:988747a15d8a93cbf116aace604177316c74d382c98c0da474af59edb9d135fa","observation_id":"2b274130-2507-4822-8319-c3e5e278fc8c","resolution":{"observed_at":"2026-08-07T15:11:04.864541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-07T15:03:59.863053Z","title":"Safety alignment for vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16640","last_updated":"2025-05-22T13:12:46Z","snapshot_observed_at":"2026-08-09T16:43:24.024535Z","submitted_at":"2025-05-22T13:12:46Z","title":"BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:59.863053Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2505.16640"},"observation_digest":"sha256:25351f217b7f214f3a1149e8349cb7ba1fcbfd0df3c57b6397e734a02a6008f6","observation_id":"c7dbf271-07ba-4189-9537-d477baeae198","resolution":{"observed_at":"2026-08-07T15:03:59.863053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-07T05:19:00.692234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08399","last_updated":"2025-06-11T06:57:37Z","snapshot_observed_at":"2026-08-09T16:20:12.110401Z","submitted_at":"2025-06-10T03:13:50Z","title":"SafeCoT: Improving VLM Safety with Minimal Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:00.692234Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2506.08399"},"observation_digest":"sha256:2d7438e3101fe886a3e2934990771599aa1a2d061a6a30d4d421c697c5f7ae34","observation_id":"ead23f03-ad26-4c20-9ad5-a69187c4afd6","resolution":{"observed_at":"2026-08-07T05:19:00.692234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2405.13581","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-07-04T07:29:39.387246Z","title":"Safety Alignment for Vision Language Models","venue":null,"work_id":"528605d5-3a66-44b7-ba90-b405f7bb8eee","year":2024},"citing_paper":{"arxiv_id":"2506.09067","last_updated":"2026-04-09T22:50:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-08T16:26:51Z","title":"Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T10:54:55.262180Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2506.09067"},"observation_digest":"sha256:70c4701a4970141957f9f95488bbd6ffff905ed49f103c7afb0841ecd625dcdc","observation_id":"404387ab-8742-451f-b24f-72d358263b4d","resolution":{"observed_at":"2026-05-19T10:57:16.523392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-06T17:21:35.272675Z","title":"Safety Alignment for Vision Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-06T17:12:51.246126Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.272675Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:24c1d4934c7887ce01eef36f6464266147356d68e4369e6f018573bb0bb0af53","observation_id":"3acacffc-bf8e-4d23-8f7e-673730b424ca","resolution":{"observed_at":"2026-08-06T17:21:35.272675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-06T11:34:27.336758Z","title":"Safety Alignment for Vision Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22617","last_updated":"2025-07-30T12:37:29Z","snapshot_observed_at":"2026-08-06T22:42:04.029387Z","submitted_at":"2025-07-30T12:37:29Z","title":"Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:27.336758Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2507.22617"},"observation_digest":"sha256:a2a100de20556856c96b09abec7a58c6ad0498e9e67acabbcd223c6beb8ce956","observation_id":"96618f7e-b14f-4842-acdb-1b997d5f3982","resolution":{"observed_at":"2026-08-06T11:34:27.336758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-05T20:29:07.179820Z","title":"Liu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-09T12:54:37.629481Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":239,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:07.179820Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:0958a0d1a9826dfd2f0cd7c68a2ad8c10a32d15a52b8e1e047480db1b87d1103","observation_id":"082c05d6-cde0-4581-83ae-25958a556f28","resolution":{"observed_at":"2026-08-05T20:29:07.179820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-03T11:47:41.187248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.05150","last_updated":"2026-05-29T00:04:54Z","snapshot_observed_at":"2026-08-03T11:47:39.412842Z","submitted_at":"2026-01-08T17:40:50Z","title":"$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T11:47:41.187248Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2601.05150"},"observation_digest":"sha256:fc0bbcf5cb823b274a2ca7cbe62f12473b1a140c5fded6e19a02a0a12544f546","observation_id":"578261e9-e7a0-4aef-a60a-d14880be6f53","resolution":{"observed_at":"2026-08-03T11:47:41.187248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2405.13581","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-07-04T07:29:39.387246Z","title":"Safety Alignment for Vision Language Models","venue":null,"work_id":"528605d5-3a66-44b7-ba90-b405f7bb8eee","year":2024},"citing_paper":{"arxiv_id":"2605.15030","last_updated":"2026-05-14T16:26:27Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:26:27Z","title":"WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T20:16:13.413064Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2605.15030"},"observation_digest":"sha256:7186bd4530521291dace159673d589dca0d4abe20c4ca11a00915e21c6e1dd28","observation_id":"680f3798-8504-49e3-bca8-95403b07530a","resolution":{"observed_at":"2026-07-01T14:45:49.534009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2405.13581","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-07-04T07:29:39.387246Z","title":"Safety Alignment for Vision Language Models","venue":null,"work_id":"528605d5-3a66-44b7-ba90-b405f7bb8eee","year":2024},"citing_paper":{"arxiv_id":"2606.21147","last_updated":"2026-06-19T06:37:32Z","snapshot_observed_at":"2026-07-06T23:56:12.374739Z","submitted_at":"2026-06-19T06:37:32Z","title":"AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T13:22:12.541923Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2606.21147"},"observation_digest":"sha256:feb52fa372117822f7456297fe002560f42b52c21439a850c320ee2805b9b869","observation_id":"e6b89c78-534a-46fb-85a7-dc41db16909a","resolution":{"observed_at":"2026-07-04T07:29:39.388826Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13581","snapshot_observed_at":"2026-08-07T21:24:15.097357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05909","last_updated":"2026-08-06T11:39:08Z","snapshot_observed_at":"2026-08-09T23:12:30.859801Z","submitted_at":"2026-08-06T11:39:08Z","title":"MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T21:24:15.097357Z"},"links":{"cited_paper":"/paper/2405.13581","citing_paper":"/paper/2608.05909"},"observation_digest":"sha256:22a2bb7f46be83c6aa4781b21b9912e7fd8269f9d3fcdca1a887627b234583cb","observation_id":"9527eb5a-91c8-4468-a724-a021aaa76373","resolution":{"observed_at":"2026-08-07T21:24:15.097357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.13581/citation-record","integrity":"/paper/2405.13581/integrity","json":"/paper/2405.13581/citation-record.json","paper":"/paper/2405.13581"},"outbound":[],"paper":{"arxiv_id":"2405.13581","last_updated":"2024-05-22T12:21:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:03:51.692003Z","submitted_at":"2024-05-22T12:21:27Z","title":"Safety Alignment for Vision Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2405.13581."}