{"as_of":"2026-08-16T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd91defd28b056329bf339a4796f668864f62323ab5a479f4e07f2486412a3c6","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:24:49.761179Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10513/citation-record","integrity":"/paper/2608.10513/integrity","json":"/paper/2608.10513/citation-record.json","paper":"/paper/2608.10513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.286087Z","title":"Communication, Simulation, and Intelligent Agents: Implications of Personal Intelligent Machines for Medical Education","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.286087Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:50414a563718e9dfd84434841f3b6bc0ca82bef33e303f1982ee92b799d8def6","observation_id":"6025fc5e-cb13-4b9e-a1f7-bcc2fbfedd4b","resolution":{"observed_at":"2026-08-15T14:24:49.286087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.291857Z","title":"Classification Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.291857Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:0252c0a8c136c5b233017d9c03ad3a144aec853e13d9e94aea359e9e1a42c1b8","observation_id":"aafe544d-f17a-4557-a3b7-65bcaa860b07","resolution":{"observed_at":"2026-08-15T14:24:49.291857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.297126Z","title":", title =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.297126Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:9fcba8e1786fe23cd9aa89841badb7ec43756d48e348b4736524669ba29fbc13","observation_id":"03f39d12-37c9-475e-8996-782a28b02c46","resolution":{"observed_at":"2026-08-15T14:24:49.297126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.302190Z","title":"New Ways to Make Microcircuits Smaller---Duplicate Entry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.302190Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:1c4199cf5e3d81485fd69df9ad1c03952142af767e1d4866f5e31ec117fdbd06","observation_id":"9b684ccd-2da1-4a2e-bd08-f0b86098ad39","resolution":{"observed_at":"2026-08-15T14:24:49.302190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.307325Z","title":"Clancey and Glenn Rennels , abstract =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.307325Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:d8b8b1b349535a1ce7cb8ffab08b106ed9784087330da7df873baf96cea03374","observation_id":"6e7c5bc3-0353-4ce4-a8bb-05eedb4e6db7","resolution":{"observed_at":"2026-08-15T14:24:49.307325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.312726Z","title":"and Rennels, Glenn R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.312726Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:32deb6cd6d5e17ffebe091601a2d529b16164681e54c976f53bc55e6e27935e2","observation_id":"b370780d-21ed-4d8e-922a-391605fab0d1","resolution":{"observed_at":"2026-08-15T14:24:49.312726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.318979Z","title":"Poligon: A System for Parallel Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.318979Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:9cc305f0d75ca3d691eb307eff4d96590d6ca2cef787a896d832ef4b7df38891","observation_id":"7c2213ad-8c12-4d7b-a616-e70bc73431ad","resolution":{"observed_at":"2026-08-15T14:24:49.318979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.324337Z","title":"Transfer of Rule-Based Expertise through a Tutorial Dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.324337Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:efe64e0f522907cc28e0333829f574182717739062277c45d22840dac710bfd8","observation_id":"1af58472-120b-4390-a2f6-3e45ba91d558","resolution":{"observed_at":"2026-08-15T14:24:49.324337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.330017Z","title":"The Engineering of Qualitative Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.330017Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:2d11cc475db3acab22667b8ae38b0a3047500e222423fad66c411c3c419914a1","observation_id":"30e37e8f-9630-4387-a5dc-7562ba936e85","resolution":{"observed_at":"2026-08-15T14:24:49.330017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.334945Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.334945Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:866a7d5a751d5327a4c5aa21bfa68807d96d29692d452fd90399a5295598a311","observation_id":"8dd50b5f-f6b2-47c0-b120-2f58e7e202f2","resolution":{"observed_at":"2026-08-15T14:24:49.334945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.340125Z","title":"Pluto: The 'Other' Red Planet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.340125Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:257b972229423f180e47ed38a30de46463d2123da4bd645b4e353c102b191382","observation_id":"8412b579-2ad8-4563-9fc2-71154bb189a0","resolution":{"observed_at":"2026-08-15T14:24:49.340125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.155702Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"64ea129b-4610-40c8-891e-1f3e8b0bf0a8","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.366719Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:3a2d991e1a9c127d668a8c5889155ac17744acdc573253ec5fa9810b981c6af5","observation_id":"228938b6-472c-4002-bb00-eaa25e47f0d7","resolution":{"observed_at":"2026-08-15T14:24:51.161453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.139324Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"72fbc254-d0da-4bd3-ad68-789477293117","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.387989Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e088f59d25a1f1ac766107a962a5eaeaeb4c5e95127800cdf199068f08d6cc88","observation_id":"08e7d26c-4bf3-49e6-8c3b-0f8a7c03056b","resolution":{"observed_at":"2026-08-15T14:24:51.144189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.121911Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"d6d5c695-eefa-43d5-b380-d16f9d5b7654","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.392957Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:b682baf6ee51d8ba2caed3f9309349b038fbab2e1d38adca16fd56855311fce0","observation_id":"83099ffa-5463-4801-8505-c206be410151","resolution":{"observed_at":"2026-08-15T14:24:51.127311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.105198Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"88ae35ab-6392-4509-9059-c1bbf940d938","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.419372Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:6756b5ad8a9b4606b575f9d91506b0a9c1123df194093bc7102481743be8ae5e","observation_id":"3dd945eb-064e-4277-833e-943d8cc322aa","resolution":{"observed_at":"2026-08-15T14:24:51.110729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.087763Z","title":null,"venue":null,"work_id":"b8f94ad5-72fe-4329-9f92-981a3d736aa2","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.429522Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:83a78c1408e03e763aab7a8e397c74ad2140ce7256b417070f11fe1eb73a5c57","observation_id":"c0c9e85f-a084-4bbb-96e2-1570013db0a5","resolution":{"observed_at":"2026-08-15T14:24:51.093297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.071103Z","title":"2024 , organization=","venue":null,"work_id":"71c0847e-b3e5-4d33-875f-a4f06c36eca5","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.434452Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:c18980ae9f6bad50973e82669ca83090b35880d6380e9d0a0c22c862e655167f","observation_id":"4e7208e8-6538-4df6-b419-8ca1cf767783","resolution":{"observed_at":"2026-08-15T14:24:51.076144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.051519Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"fb5a8e21-ed97-48a1-8832-478debfbe184","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.440055Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:a36fea0ab7764274ea1c086be1912d64ea40a9b3db4599eaaac9a3754cecf6a8","observation_id":"3b98b798-fc97-4541-bc10-1eec8dbbd7f8","resolution":{"observed_at":"2026-08-15T14:24:51.058351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.033101Z","title":null,"venue":null,"work_id":"2588a65a-4e69-43fc-9639-2043ad6602fa","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.445335Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:03be94044d61332237968ae52a326bb3ef975bcb3750de885363f02e03995ee1","observation_id":"af1397e5-5deb-4e3a-8ee1-3a02f280d7c2","resolution":{"observed_at":"2026-08-15T14:24:51.038568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.014737Z","title":null,"venue":null,"work_id":"08916d13-5aae-445a-b5bf-50d2c12c2b3f","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.455750Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:5e6aa529ebaab04fb2fc68a63e346cd9c5415f0e4bec5e5994afdead94674120","observation_id":"bd1c348e-53c4-4dfd-ac82-5f65f525fdf2","resolution":{"observed_at":"2026-08-15T14:24:51.019929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.998135Z","title":"Immune: Improving Safety Against Jailbreaks in Multi-modal","venue":null,"work_id":"4c8c204a-d89e-498a-ad3e-aadd54d84a6b","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.460698Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:f0bdf8a9c2e595721cb6cc61cba4b7daf729de8c09ba71294d8580cbb812cd4c","observation_id":"7c801524-ce3b-49e5-af20-dae48fee7937","resolution":{"observed_at":"2026-08-15T14:24:51.003543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.981034Z","title":null,"venue":null,"work_id":"3aee47b6-ecdc-4678-9707-3df20e55a770","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.477037Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:374ce1a38d56651269a99597c020eaf08bf2a9981a0ad557c016f416a0bff90c","observation_id":"217032c7-0fc6-4961-983f-9dfe298829f1","resolution":{"observed_at":"2026-08-15T14:24:50.985880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.963506Z","title":null,"venue":null,"work_id":"8c897429-2bde-45a3-8a17-fd3b0d39ff19","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.481819Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e10092fadbf26311a5df83edc813b3a07f13e3f2c60c6f5e9489129bc7bc8efa","observation_id":"ec4efce1-7f79-4e07-9aa5-0179b1da6d55","resolution":{"observed_at":"2026-08-15T14:24:50.968545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.946648Z","title":"Computer Vision -- ECCV 2024 , year=","venue":null,"work_id":"3937c21e-a2f8-4c88-a2ed-6460c4f94a33","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.486867Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:8897ca088a2738e9d3abb51727869174a50df76cfa6223f1679adaaa309e5dca","observation_id":"a63deb8f-bea4-4fa6-b41b-7cc2d9cdeff8","resolution":{"observed_at":"2026-08-15T14:24:50.952194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.929858Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"bd556cd2-71fe-4d8c-b147-3fa425809e07","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.491449Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:dd672bddeb0b457136a298b80697260db69969cba95d8872f97e9802af45fa4f","observation_id":"953d98a7-bbe0-4ebd-b7b5-21f38ce009f0","resolution":{"observed_at":"2026-08-15T14:24:50.935088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.913023Z","title":"2025 , eprint=","venue":null,"work_id":"41dd196d-e919-4f55-8f02-6bb6bff8915c","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.496220Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:7f5977961b7f59bca21c4dfd1bbb7188b737bdcaf31556fb2e4998f12345803a","observation_id":"2c142d4a-a0a0-47df-913c-31da69c8f934","resolution":{"observed_at":"2026-08-15T14:24:50.918592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.896355Z","title":null,"venue":null,"work_id":"8846f5b1-7a2a-4344-ac16-8c519ef08c18","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.506246Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:5754056931936c837f95ad668069767c76140cfb6ba53fb03dfd9dc9eb66dc02","observation_id":"034ce379-cce3-4d28-9fb0-a351d1e9e384","resolution":{"observed_at":"2026-08-15T14:24:50.901331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.516080Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.516080Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e7b05b4e50d0a090fd5a5e6827777f9727e95692eecc983c209da5222eeaf951","observation_id":"4d562cb7-31a3-43b9-a9dc-e10ec02ef7d5","resolution":{"observed_at":"2026-08-15T14:24:49.516080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.546118Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.546118Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:45e3d5ab69df4209fb67a6d1679218b7ac9310069dd9772344b73bc539d56dc4","observation_id":"3d8d9528-f3c7-4256-862a-3c5a8ccba9fa","resolution":{"observed_at":"2026-08-15T14:24:49.546118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.859010Z","title":"2025 , howpublished=","venue":null,"work_id":"8ce11c6c-ef27-4011-85b9-9d0a07db4a83","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.551124Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:56c2c8eb6f5e489ba40a18c1e6dd152f098e9c422c60ac72977ded3747fa137a","observation_id":"42b41b8a-ddef-45ae-a798-53896366a1fd","resolution":{"observed_at":"2026-08-15T14:24:50.863889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.843830Z","title":null,"venue":null,"work_id":"af9b9844-ebe0-4fa6-942a-79ac1765c049","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.561077Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:69b95a49088a758586e3dcf80413238dc5a3eff132358f130b5663b388c4892c","observation_id":"b99c6442-d704-4675-9462-6145ec9c58e7","resolution":{"observed_at":"2026-08-15T14:24:50.848497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.566112Z","title":"S.; Dong, Y.; Roy-Chowdhury, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.566112Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:86da29e1a304e784da17a37a1b0866254b0d38557b42bb42876376699de5d71c","observation_id":"7af71618-73f6-4217-a0d6-926fb2b4d874","resolution":{"observed_at":"2026-08-15T14:24:49.566112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.828136Z","title":null,"venue":null,"work_id":"67cfe607-6d20-4227-b9d7-aa370ecd803a","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.570974Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:ff736a13a6cc8a2241ec0351dba6be910d2b3834291864a56f73575fff886574","observation_id":"fcac46c4-dee3-4c64-9f6c-298a3dc99766","resolution":{"observed_at":"2026-08-15T14:24:50.833135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T14:24:49.575768Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.575768Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:fb39b1a0496fdba0be26a4894364c2472105f29336359f71cc3013a41ec6f794","observation_id":"ead0cd05-33b7-4a54-9afc-9b2b4d1ec861","resolution":{"observed_at":"2026-08-15T14:24:49.575768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.580381Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.580381Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:860d57f3fb63b834cb957807c5a44d7b78af58bec6825e303b7c7b468a2df084","observation_id":"59813561-4a5a-4fbc-88bb-df1b70ebd447","resolution":{"observed_at":"2026-08-15T14:24:49.580381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-15T14:24:49.585173Z","title":"A.; Ma, W.-C.; and Krishna, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.585173Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:dbff8713cc420ca2e78fabe929441e210661a4a701dcdd7f51e1a2a6c6404156","observation_id":"22e5aa0d-b540-4990-9f7d-b19fcaec8339","resolution":{"observed_at":"2026-08-15T14:24:49.585173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-15T14:24:49.589605Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.589605Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:b07f720adfe3ee964f16261f24b833c72025e167e9fc4d858516311985a67d87","observation_id":"5948ede7-3092-4529-985d-e8cfa1c54525","resolution":{"observed_at":"2026-08-15T14:24:49.589605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.811669Z","title":"S.; Chakraborty, S.; Singh, V.; Guan, T.; Wang, M.; Velasquez, A.; Beirami, A.; Huang, F.; Manocha, D.; and Bedi, A","venue":null,"work_id":"7e759238-8468-43c9-a37e-2f95d2d050ac","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.594546Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:fe261c9661d4d548a8faf88566e9feb480e6c5927102b31508b516985fa5903b","observation_id":"31627a61-ebd4-4a9b-ab3a-ae7869c2a350","resolution":{"observed_at":"2026-08-15T14:24:50.817152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-08-13T15:57:44.715549Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-15T14:24:49.599621Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.599621Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:7f576911a38012df1fe642f808a8b04a5bea34f033d4dbafb481948192d7158f","observation_id":"28abac41-ddee-48b4-b94f-af4761b95fc6","resolution":{"observed_at":"2026-08-15T14:24:49.599621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.795990Z","title":"T.; and Zhang, Y","venue":null,"work_id":"55af4183-e2d5-4f5b-abbf-343ab65c760c","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.604537Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:8dda54adc980557b1b969f8d46097737a0fbf5f0b212554da187884c0b29fb15","observation_id":"25918594-f841-43f1-8862-2212b3e99ad6","resolution":{"observed_at":"2026-08-15T14:24:50.800740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11619","last_updated":"2025-03-14T17:39:45Z","snapshot_observed_at":"2026-08-07T17:03:15.429725Z","submitted_at":"2025-03-14T17:39:45Z","title":"Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense","version":1},"cited_work":{"arxiv_id":"2503.11619","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11619","snapshot_observed_at":"2026-08-15T14:24:50.315811Z","title":"Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense","venue":"cs.CR","work_id":"262c0d08-303d-4845-8f11-749a393c7c8e","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.609578Z"},"links":{"cited_paper":"/paper/2503.11619","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:f5bb192be0edb8e61c84005967f4c513c8c0461a08505863feda5a683f182f21","observation_id":"4dd94b19-98cd-4cea-987c-4013b0862739","resolution":{"observed_at":"2026-08-15T14:24:50.323213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.780012Z","title":null,"venue":null,"work_id":"39676efa-18d3-4be2-bf01-cebe3d1f073c","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.614405Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:4142ee04c08409c4fe87427e38e354ef286826102caa77393fa7b4f07e25fe15","observation_id":"5ac197ff-34c5-4570-82fe-84b6764a67ae","resolution":{"observed_at":"2026-08-15T14:24:50.784835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.764429Z","title":null,"venue":null,"work_id":"f3937041-1029-401e-9acd-f0f26f854705","year":2015},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.619496Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:3ef1191e8cabf77fe2efe712fc20e036622654a2c13ae65680b9cda1261b8686","observation_id":"2dc6e744-3892-41f5-815d-f8b9a5e4ff39","resolution":{"observed_at":"2026-08-15T14:24:50.769285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07571","last_updated":"2024-11-15T03:20:57Z","snapshot_observed_at":"2026-08-12T22:26:42.027225Z","submitted_at":"2024-10-10T03:12:03Z","title":"How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?","version":2},"cited_work":{"arxiv_id":"2410.07571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.07571","snapshot_observed_at":"2026-08-15T14:24:50.594188Z","title":"How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?","venue":"cs.CL","work_id":"9d1e7479-4264-4dd3-b06e-0b8e23ecb7fe","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.624109Z"},"links":{"cited_paper":"/paper/2410.07571","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:b7e4f2a4043637ed5034bda023912b0cd6433f4df2bbdbb99a9a134603470c5a","observation_id":"b9bf0e8c-3aaa-4677-8afe-b2c4d7fd2db9","resolution":{"observed_at":"2026-08-15T14:24:50.599930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09792","last_updated":"2025-01-13T03:30:37Z","snapshot_observed_at":"2026-08-15T00:32:13.784667Z","submitted_at":"2024-03-14T18:24:55Z","title":"Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09792","snapshot_observed_at":"2026-08-15T14:24:49.628739Z","title":"X.; and Wen, J.-R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.628739Z"},"links":{"cited_paper":"/paper/2403.09792","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:f3aad049f6a3e9a389304f729084b4e0d5d6dd3576a2a5e6e327f47ea4d71bb4","observation_id":"b330890a-6d8b-4c62-a945-a091af957280","resolution":{"observed_at":"2026-08-15T14:24:49.628739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-15T14:24:49.633399Z","title":"F.; Cheng, K.-T.; Choi, Y.; Kautz, J.; and Molchanov, P","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.633399Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:396bfa3d59a30506ddb3af47ccdb1ec36a359735b6b616870a475e03bef55513","observation_id":"8c6746d9-388b-4d77-992a-e3c437860635","resolution":{"observed_at":"2026-08-15T14:24:49.633399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.748469Z","title":null,"venue":null,"work_id":"19c157dd-3bf4-42c0-9ce1-b9b05257b518","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.638422Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:3fef2632209f15569931f80914d0b324662d6a059d655b70000836aaec4255eb","observation_id":"a1c14e02-0921-4471-83ab-86e644c7fb38","resolution":{"observed_at":"2026-08-15T14:24:50.753489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.731230Z","title":null,"venue":null,"work_id":"0f1e9eb8-74b1-45d0-921f-b7e3487178d5","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.643490Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:6f811ff86b6172b86555f0d84dad3aedfaf0e687b66fb92e36b1e5ee5d79fc3f","observation_id":"269c60e0-8b68-425e-9851-c51d0534576f","resolution":{"observed_at":"2026-08-15T14:24:50.736673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01703","last_updated":"2025-01-31T16:47:16Z","snapshot_observed_at":"2026-08-12T22:08:43.512027Z","submitted_at":"2024-11-03T22:19:20Z","title":"UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01703","snapshot_observed_at":"2026-08-15T14:24:49.648328Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.648328Z"},"links":{"cited_paper":"/paper/2411.01703","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:102537f11d27f87ec59604f20b4a6a3a1c4c4cfe97d2eb99502aa49008b56894","observation_id":"0566dc98-f71a-4d25-95ae-b9bf57f6730c","resolution":{"observed_at":"2026-08-15T14:24:49.648328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-13T00:13:00.853204Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-15T14:24:49.653520Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.653520Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:ca7ae94642f6d0028baeef058f8c9d0772d3539c312a12bf0d716bb0aabcd877","observation_id":"490d3cb1-abf5-456a-8af5-94c4a05e0634","resolution":{"observed_at":"2026-08-15T14:24:49.653520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02906","last_updated":"2024-06-17T16:53:49Z","snapshot_observed_at":"2026-08-14T15:58:09.590663Z","submitted_at":"2024-01-05T17:05:42Z","title":"MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02906","snapshot_observed_at":"2026-08-15T14:24:49.658164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.658164Z"},"links":{"cited_paper":"/paper/2401.02906","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:cfd9c35804bbdb0946ff4737a195cb39045b99ae994567318d4622d2f4173801","observation_id":"f1bdd4e5-71c7-40b5-a5a0-d9479f72aa14","resolution":{"observed_at":"2026-08-15T14:24:49.658164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07502","last_updated":"2024-06-11T17:37:45Z","snapshot_observed_at":"2026-08-12T23:45:17.819075Z","submitted_at":"2024-06-11T17:37:45Z","title":"Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07502","snapshot_observed_at":"2026-08-15T14:24:49.663318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.663318Z"},"links":{"cited_paper":"/paper/2406.07502","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:6cb4c804f21ebf6a5b3d629dd592ab3c1fa6076d38d7489067bd1032fb968396","observation_id":"b468061a-8828-426a-a25a-39e7fb2a1094","resolution":{"observed_at":"2026-08-15T14:24:49.663318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-13T11:10:57.614082Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-15T14:24:49.667991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.667991Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:8478ed86bdbf92b334ef6e0109da78bc9cd699b92dec9703a8ab501796b7cd80","observation_id":"ff2c9902-8178-4ac7-b812-54158f74d295","resolution":{"observed_at":"2026-08-15T14:24:49.667991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.713995Z","title":"D.; and Finn, C","venue":null,"work_id":"30904184-047a-4355-87d7-8d6cecd1d7ee","year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.672709Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:c8a9f50bd59d5be336d8d0d48dc703fe6f252e8e73286d540a31a56ccf05da5d","observation_id":"80bcc7fb-bb9c-4d73-a9a3-fce47d6851a4","resolution":{"observed_at":"2026-08-15T14:24:50.719088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.678351Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.678351Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:90bab435841c74c4c8a5e0341b6e04be69e1c734ae6e0609c8cf45b5d77d802f","observation_id":"a084824b-141e-4c09-b436-0b33272b7c61","resolution":{"observed_at":"2026-08-15T14:24:49.678351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.697543Z","title":null,"venue":null,"work_id":"5577f9bb-2708-43d9-bcee-e42b0c9b1a54","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.683390Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:d7f2b324a1cfcd0a08dd9dc2b366ded2686f14f43ccbb48a4727ab48636fc534","observation_id":"ee26d16d-fc61-46ae-9fbc-4cce92410aa5","resolution":{"observed_at":"2026-08-15T14:24:50.702794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T14:24:49.688116Z","title":"K.; Wu, Y.; and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.688116Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:b3cec3f458f6a1c1deb55175c9d4719551ecf37d4d7d7691c198fb9c067f5cef","observation_id":"f619761b-f2a6-471e-88ec-11824f613c4f","resolution":{"observed_at":"2026-08-15T14:24:49.688116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.680829Z","title":null,"venue":null,"work_id":"b4cd46a7-ba18-4bc2-8c45-b7c5fb2f4906","year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.692606Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:b14b909f9e04f26b428a245c091b7d0229deada8616b52ba797b88e1372d0a46","observation_id":"fc5301ea-d58a-41b1-b04c-c916f780f957","resolution":{"observed_at":"2026-08-15T14:24:50.685891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-08-13T17:06:00.644129Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-15T14:24:49.697447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.697447Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:1389c39960dec8795cf391f22c2082fbbb9a6d315532617824937514c293f72e","observation_id":"35a00d1f-c63b-41cb-a266-798754d1fa60","resolution":{"observed_at":"2026-08-15T14:24:49.697447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.664187Z","title":null,"venue":null,"work_id":"031e0724-5b8d-47ae-a194-266cfefc8b80","year":2015},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.702249Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:14243f311789ad577df10150fc2b1b0576f8027aa7e9de1435033a39cc022e99","observation_id":"319c5e91-143d-4896-964a-00b3ea1e1ccb","resolution":{"observed_at":"2026-08-15T14:24:50.669292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11206","last_updated":"2024-01-20T10:41:03Z","snapshot_observed_at":"2026-08-13T04:38:40.852903Z","submitted_at":"2024-01-20T10:41:03Z","title":"InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11206","snapshot_observed_at":"2026-08-15T14:24:49.707221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.707221Z"},"links":{"cited_paper":"/paper/2401.11206","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:ed7e234e2fdcf505deee26b89d5fcca8219b35939eaf91abfbbec573c9a0174b","observation_id":"60a371c4-1909-450e-ae9c-02d9c15c21ed","resolution":{"observed_at":"2026-08-15T14:24:49.707221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.647714Z","title":null,"venue":null,"work_id":"d4fc473f-69b5-4674-828a-bc631e09ce80","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.712315Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:ce71b94fc4c6713dd50e2aace4d446be7387348e0a6b89b2219425332d4f9578","observation_id":"b252a0b5-1046-4f9f-8096-c4836462f329","resolution":{"observed_at":"2026-08-15T14:24:50.652790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.717212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.717212Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:ca4681f33b74284de47037dee2621a762518dc59eb5bfeccda28ea239d3fa6ad","observation_id":"47cbe7ae-0820-4309-b7a4-a69d2c725db3","resolution":{"observed_at":"2026-08-15T14:24:49.717212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-12T22:07:51.112849Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14881","snapshot_observed_at":"2026-08-15T14:24:49.722202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.722202Z"},"links":{"cited_paper":"/paper/2502.14881","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:b2179e84e8c0504d9a99de309be74887016f1917059a03aa995f209ace912914","observation_id":"2c287b8c-e440-414c-8279-c9fa5299dea6","resolution":{"observed_at":"2026-08-15T14:24:49.722202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-15T14:24:49.727045Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.727045Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:17f9a57bbe199356d188aeee28561d776643ae610254afa4477b6b1853996261","observation_id":"d9b1a76d-8748-4a6d-ad38-cde6c6a62f53","resolution":{"observed_at":"2026-08-15T14:24:49.727045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-12T23:40:40.908503Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-15T14:24:49.731853Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.731853Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:8e7f90412f703cc0a52fff1ad3a505a95b9aeecb3d5fc62946c3dbdfd1915da2","observation_id":"0124c92d-8536-4a13-87e3-6d0eaf31fbb5","resolution":{"observed_at":"2026-08-15T14:24:49.731853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.736633Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.736633Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:94963b7bada93ae0aba80c80aa7e0e9ebfee4fe3ae31609e0b3e5d0d897a5f36","observation_id":"bff65539-c313-49db-a9ae-bb5b9155bc60","resolution":{"observed_at":"2026-08-15T14:24:49.736633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-15T14:24:49.741420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.741420Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:7c9ce3eff767d646ae9381f19f755d1a976472a533df290213cf9a48a79c3637","observation_id":"c10d224c-4731-4766-8304-f2d4adcf8da4","resolution":{"observed_at":"2026-08-15T14:24:49.741420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-08-12T22:28:01.412886Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-15T14:24:49.746172Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.746172Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e41d1a3f6e072fa5af83e21e7db542505169f7fcf1eedbf1669b9fd822678566","observation_id":"96f4e123-ea8d-4458-b644-8b37f42e79f0","resolution":{"observed_at":"2026-08-15T14:24:49.746172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-13T04:27:42.124177Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-15T14:24:49.751283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.751283Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:79f1a2b6a04636c11e3a7326a9b7c8a8716299bb549160beb914199904da50a3","observation_id":"c33304f9-7846-4db1-818e-036cdd66476b","resolution":{"observed_at":"2026-08-15T14:24:49.751283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13095","last_updated":"2025-02-18T18:06:48Z","snapshot_observed_at":"2026-08-07T18:07:37.503310Z","submitted_at":"2025-02-18T18:06:48Z","title":"Understanding and Rectifying Safety Perception Distortion in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13095","snapshot_observed_at":"2026-08-15T14:24:49.755989Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.755989Z"},"links":{"cited_paper":"/paper/2502.13095","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:3b3176f60fe572ade7c725a9bb3bfbdd67c131206a756da718a1695c5e7ec978","observation_id":"0d7bae29-0166-43e4-84d7-a3053f47ca88","resolution":{"observed_at":"2026-08-15T14:24:49.755989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02534","last_updated":"2024-08-26T22:56:28Z","snapshot_observed_at":"2026-08-14T02:35:43.814156Z","submitted_at":"2024-07-01T16:58:55Z","title":"Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02534","snapshot_observed_at":"2026-08-15T14:24:49.761179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.761179Z"},"links":{"cited_paper":"/paper/2407.02534","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:3fb218d346c9a012480a65aba68ca0b5041eebe0775abb57bf6f2a19958432b2","observation_id":"fcbbe27f-914f-4b57-9fd5-cf34162e1e2e","resolution":{"observed_at":"2026-08-15T14:24:49.761179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2608.10513."}