{"as_of":"2026-08-18T11:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:502d6a12a8d4a94eaa5aca77e667b0153c8fb24c17c402e5d1fd19b289d400d0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:24:49.653520Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T19:45:21.791386Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-10T20:06:24.601160Z","title":"Learning to see but forgetting to fol- low: Visual instruction tuning makes llms more prone to jail- break attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.601160Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:301f8a1b2d2f652c050b1c534c176aacf638767661981bb729ca7464dda7bde3","observation_id":"f12e9d07-da67-49af-9d46-e5fc31267973","resolution":{"observed_at":"2026-08-10T20:06:24.601160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":"2405.04403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-07T19:45:21.791386Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","venue":"cs.CV","work_id":"a18b6b40-6c84-4772-8abe-66dd7c313722","year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-12T22:07:51.112849Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:19.075445Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:6fc3d68ba05633ab5be39a92bd0d55063f86075cd9fc2cdf600dda03b370a91b","observation_id":"d7d16bc6-919d-4354-ae2b-346450b22a2b","resolution":{"observed_at":"2026-08-07T19:45:21.797042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-04T09:02:39.371506Z","title":"Learning to see but forgetting to follow: Visual instruction tuning makes llms more prone to jailbreak attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.371506Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:7b4cea7c9d22ffe2e6cd61aa5922e086083c688bab86591a0291f2bfd934e7d2","observation_id":"dadd5531-ff1d-44e6-aedc-3ccc2cf2827b","resolution":{"observed_at":"2026-08-04T09:02:39.371506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-03T11:47:41.539959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.05150","last_updated":"2026-05-29T00:04:54Z","snapshot_observed_at":"2026-08-14T07:13:37.721852Z","submitted_at":"2026-01-08T17:40:50Z","title":"$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T11:47:41.539959Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2601.05150"},"observation_digest":"sha256:1552266d6e9524319927010dc5e13529839f063f5c24ee02b7b5e35183463c65","observation_id":"34595cda-3422-43bf-b86c-5a7e86519096","resolution":{"observed_at":"2026-08-03T11:47:41.539959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-15T14:24:49.653520Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.653520Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:9de59a7f87ddbd1a685e3568a5ef974607a110acdd24a7d12e0afe702d3c0063","observation_id":"490d3cb1-abf5-456a-8af5-94c4a05e0634","resolution":{"observed_at":"2026-08-15T14:24:49.653520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.04403/citation-record","integrity":"/paper/2405.04403/integrity","json":"/paper/2405.04403/citation-record.json","paper":"/paper/2405.04403"},"outbound":[],"paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2405.04403."}