{"as_of":"2026-08-08T07:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d23028ae918867cb3fb0e0cec7c15dc1da1bd6c5329f45c1dd5b4d03e964b0d8","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:34:37.431217Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24232/citation-record","integrity":"/paper/2505.24232/integrity","json":"/paper/2505.24232/citation-record.json","paper":"/paper/2505.24232"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:32.447358Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.447358Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:444d309c3f99fb3ae66782364144414f8fbfb4604398e59a78c6fc89f510c25c","observation_id":"e35ecabd-0d1e-4c7b-9611-f606becda309","resolution":{"observed_at":"2026-08-07T12:34:32.447358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-07T12:34:32.513188Z","title":"do anything now","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.513188Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:2cc7d58ed924a03475231b91b772eff37af792dbcaff12a46703223f07418071","observation_id":"c1d163ed-ece8-4eee-8c4a-5f1de2657dcd","resolution":{"observed_at":"2026-08-07T12:34:32.513188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:32.562775Z","title":"Defending chatgpt against jailbreak attack via self-reminders.Nature Machine Intelligence, 5(12):1486–1496, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.562775Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:b565a1b1f872c7d6ca2cd988ff0b537d72275e6cf71a8af336e3bb6f5013a7eb","observation_id":"6b6dafde-1e18-4ff5-a51d-c0f0326916f1","resolution":{"observed_at":"2026-08-07T12:34:32.562775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:32.729370Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.729370Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:02d7fff1b1ca88dbcb1dcb3bac3c02a95ff4e078af2c6cfb49d919cc22e5ea9e","observation_id":"ab5dc5e0-dbe8-408b-ad5b-74309992baaa","resolution":{"observed_at":"2026-08-07T12:34:32.729370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:34:32.878990Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.878990Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:e73b0f8309cdec9b25e1bc61d16c714d83605bc1bae093edda25431531feb379","observation_id":"7d16e534-ae4a-4e03-a9e5-8de253fa91a5","resolution":{"observed_at":"2026-08-07T12:34:32.878990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:33.055462Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.055462Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:11e60294ad42721ef8f861c469b951b8b8661beb33f5bdafd60965525e573733","observation_id":"228d84c1-4589-483e-83c3-3e103d475d26","resolution":{"observed_at":"2026-08-07T12:34:33.055462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07071","last_updated":"2024-10-03T17:26:48Z","snapshot_observed_at":"2026-08-07T22:30:00.934349Z","submitted_at":"2024-07-09T17:44:34Z","title":"Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07071","snapshot_observed_at":"2026-08-07T12:34:33.183946Z","title":"Lookback lens: Detecting and mitigating contextual hallucinations in large language models using only attention maps.arXiv preprint arXiv:2407.07071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.183946Z"},"links":{"cited_paper":"/paper/2407.07071","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:0722889bc35bedb9dfcd1a6badda22fe7bccf23d2664eec51ac59693ddc6016a","observation_id":"4c6fcf8d-c3d7-485e-b0e3-0974b692ccc8","resolution":{"observed_at":"2026-08-07T12:34:33.183946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15098","last_updated":"2024-04-17T04:25:21Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:48:55Z","title":"Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15098","snapshot_observed_at":"2026-08-07T12:34:33.321878Z","title":"Attention satisfies: A constraint-satisfaction lens on factual errors of language models.arXiv preprint arXiv:2309.15098, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.321878Z"},"links":{"cited_paper":"/paper/2309.15098","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:77f2dea2b1499f8716b15a950c82ea464e0eb542060e15327ac1759c760b1d4a","observation_id":"7ca8e42f-9646-4f40-b65c-8ee8cde55c58","resolution":{"observed_at":"2026-08-07T12:34:33.321878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13734","snapshot_observed_at":"2026-08-07T12:34:33.468297Z","title":"The internal state of an llm knows when it’s lying.arXiv preprint arXiv:2304.13734, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.468297Z"},"links":{"cited_paper":"/paper/2304.13734","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:504f03621a27c891f58891d754ccc2bbef73b39dc4a4de47b39b41860e528292","observation_id":"bf596b9f-910d-46d3-b4a9-aa9a91c2ae6b","resolution":{"observed_at":"2026-08-07T12:34:33.468297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:39.501583Z","title":"Llm factoscope: Uncovering llms’ factual discernment through measuring inner states","venue":null,"work_id":"7eace675-3ae9-48ea-b340-63486b9ca923","year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.585739Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5f7c1fe89f12e8cfcc9fb328d7aa9cae2828c84fe89dc54e7e772d2add61d3cc","observation_id":"8e9f5913-57a1-4726-9a22-4937b27042c4","resolution":{"observed_at":"2026-08-07T12:34:39.576187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19648","last_updated":"2024-05-30T03:00:47Z","snapshot_observed_at":"2026-07-06T18:22:22.643181Z","submitted_at":"2024-05-30T03:00:47Z","title":"Detecting Hallucinations in Large Language Model Generation: A Token Probability Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19648","snapshot_observed_at":"2026-08-07T12:34:33.685570Z","title":"Detecting hallucinations in large language model generation: A token probability approach.arXiv preprint arXiv:2405.19648, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.685570Z"},"links":{"cited_paper":"/paper/2405.19648","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:0e4c1c28def9571d153ea0432e0cfd30d5a186aaa3d6e6fc8c36291dcb84dfbd","observation_id":"0bf08dfa-e27a-450f-a48a-f511d3f98adb","resolution":{"observed_at":"2026-08-07T12:34:33.685570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T12:34:33.845038Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.845038Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:0cdc09ca63e239eb58cb512c40cdf31be21be6c7e80888bc72a31b679d76be42","observation_id":"99ffbb33-564d-47a1-b37d-2b06830a0d9e","resolution":{"observed_at":"2026-08-07T12:34:33.845038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15140","last_updated":"2023-12-14T06:22:51Z","snapshot_observed_at":"2026-08-03T19:47:58.067345Z","submitted_at":"2023-10-23T17:46:07Z","title":"AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15140","snapshot_observed_at":"2026-08-07T12:34:34.003149Z","title":"Autodan: Automatic and interpretable adversarial attacks on large language models.arXiv preprint arXiv:2310.15140, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.003149Z"},"links":{"cited_paper":"/paper/2310.15140","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:93dcdad15da6110d002ba0555bad3255663608483b0b8d7af2b4a735a7c6fb8d","observation_id":"25e2e540-3aba-44b3-850c-3469a159a4b6","resolution":{"observed_at":"2026-08-07T12:34:34.003149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:34.167588Z","title":"Guard: Role-playing to generate natural-language jailbreakings to test guideline adherence of large language models.arXiv preprint arXiv:2402.03299, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.167588Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:07072627cfd4e544594f5844c0279ab1aadb49390758ae1956f101768db9c546","observation_id":"a0cad85c-55d5-4f37-9815-ac974c527827","resolution":{"observed_at":"2026-08-07T12:34:34.167588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20413","last_updated":"2024-05-30T18:38:36Z","snapshot_observed_at":"2026-07-06T18:22:57.400982Z","submitted_at":"2024-05-30T18:38:36Z","title":"Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20413","snapshot_observed_at":"2026-08-07T12:34:34.241608Z","title":"Jailbreaking large language models against moderation guardrails via cipher characters.arXiv preprint arXiv:2405.20413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.241608Z"},"links":{"cited_paper":"/paper/2405.20413","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5ed3809fbe6f64a512782998bde9806fafbfc239cebeb335246257bad9d7a2d5","observation_id":"79c19ef7-639f-4dca-99db-c8d3a743b0e5","resolution":{"observed_at":"2026-08-07T12:34:34.241608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T12:34:34.347192Z","title":"Jailbreaking black box large language models in twenty queries.arXiv preprint arXiv:2310.08419, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.347192Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:ca439c5ad6756937a5bf30afd439e90e366aac37f7bef66daf47ee707fdca95e","observation_id":"29787c52-bcc5-40eb-8475-36a31bd4a65a","resolution":{"observed_at":"2026-08-07T12:34:34.347192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:34.434538Z","title":"Jailbreakzoo: Survey, landscapes, and horizons in jailbreaking large language and vision-language models.arXiv preprint arXiv:2407.01599, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.434538Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:2bc38fceccd9cc1f185fc2e5e780150cf6d668f7e7961e62ce8531d08c5bc132","observation_id":"06467daa-7a79-41c9-a2a9-30d088d57aaa","resolution":{"observed_at":"2026-08-07T12:34:34.434538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05197","last_updated":"2023-11-01T05:14:01Z","snapshot_observed_at":"2026-07-06T15:14:24.794122Z","submitted_at":"2023-04-11T13:05:04Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05197","snapshot_observed_at":"2026-08-07T12:34:34.521629Z","title":"Multi-step jailbreaking privacy attacks on chatgpt.arXiv preprint arXiv:2304.05197, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.521629Z"},"links":{"cited_paper":"/paper/2304.05197","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:0c222114ef3eeb0240acdf553c54ef982540e862502c5b72086fe7c3eb4984fc","observation_id":"b71f90d3-ed83-411a-953f-8f89b9ec73c1","resolution":{"observed_at":"2026-08-07T12:34:34.521629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08979","last_updated":"2023-10-05T13:27:12Z","snapshot_observed_at":"2026-07-30T23:17:31.332560Z","submitted_at":"2023-04-18T13:20:45Z","title":"In ChatGPT We Trust? Measuring and Characterizing the Reliability of ChatGPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08979","snapshot_observed_at":"2026-08-07T12:34:34.621558Z","title":"In chatgpt we trust? measuring and characterizing the reliability of chatgpt.arXiv preprint arXiv:2304.08979, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.621558Z"},"links":{"cited_paper":"/paper/2304.08979","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5fb7a0c33195da129ecc78d2bb486e4cde1e2fff3c5f91bc9cc65d176181945d","observation_id":"75a00167-735f-4d5b-84bf-38140ee83424","resolution":{"observed_at":"2026-08-07T12:34:34.621558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-07T12:34:34.714953Z","title":"Jailbroken: How does llm safety training fail?arXiv preprint arXiv:2307.02483, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.714953Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:929501fdd37b16d499cad7d1334756022beb86d2a73eaaae962b7dbec7198f30","observation_id":"47e5f63f-0824-4a7c-a89a-75e1252df0cb","resolution":{"observed_at":"2026-08-07T12:34:34.714953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12329","last_updated":"2024-12-07T23:09:49Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:01:36Z","title":"Query-Based Adversarial Prompt Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12329","snapshot_observed_at":"2026-08-07T12:34:34.809699Z","title":"Query- based adversarial prompt generation.arXiv preprint arXiv:2402.12329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.809699Z"},"links":{"cited_paper":"/paper/2402.12329","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:c89f15481e0607a0b064d8f12b0413f4e96bda1c7584a24607f888a5da37f6d4","observation_id":"cc291607-87bc-4601-8fff-56431417bdf9","resolution":{"observed_at":"2026-08-07T12:34:34.809699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07865","last_updated":"2024-09-14T11:41:49Z","snapshot_observed_at":"2026-08-08T03:05:44.913138Z","submitted_at":"2024-03-12T17:55:38Z","title":"CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code Completion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07865","snapshot_observed_at":"2026-08-07T12:34:34.930392Z","title":"Ex- ploring safety generalization challenges of large language models via code.arXiv preprint arXiv:2403.07865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.930392Z"},"links":{"cited_paper":"/paper/2403.07865","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:57e7d756f2011dacad628e3a801ae7c18153239625a2c0c1a01421e4f4f87634","observation_id":"b24cd802-df9b-4580-8ccb-2f148221cb3a","resolution":{"observed_at":"2026-08-07T12:34:34.930392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16914","last_updated":"2024-11-11T23:08:20Z","snapshot_observed_at":"2026-07-06T17:35:45.288097Z","submitted_at":"2024-02-25T17:43:29Z","title":"DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16914","snapshot_observed_at":"2026-08-07T12:34:35.024627Z","title":"Drattack: Prompt decomposition and reconstruction makes powerful llm jailbreakers.arXiv preprint arXiv:2402.16914, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.024627Z"},"links":{"cited_paper":"/paper/2402.16914","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:536ccf31f57e9c6674d07db89decdf300e44df8dcbe51931036c10fd636e4c4b","observation_id":"bdcec99b-775e-4fe4-8083-8ac83e1925fc","resolution":{"observed_at":"2026-08-07T12:34:35.024627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-07-06T16:05:31.757410Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-07T12:34:35.156845Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher.arXiv preprint arXiv:2308.06463, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.156845Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:39efe5e9c2c8ed79dc03a9cb746b0b4d57be88e420892cb4d57ddee5dd5b8bf2","observation_id":"25ce4ff6-5ffe-4b86-864f-aa98df872c3b","resolution":{"observed_at":"2026-08-07T12:34:35.156845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:35.268065Z","title":"Jailbreaking proprietary large language models using word substitution cipher.arXiv preprint arXiv:2402.10601, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.268065Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:40246835f3d21179f7d3f9bbb02f7c29cd3d7ca3de2c683d251a4d297cbae391","observation_id":"c52ceef5-c819-4a08-b794-1da06089cc8c","resolution":{"observed_at":"2026-08-07T12:34:35.268065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:35.415641Z","title":"Are aligned neural networks adversarially aligned?Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.415641Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:cc6acd7636bbaef627030e607ea86ac2309b263dda0b78d7f9acfbc105309951","observation_id":"308a610b-bc2e-431e-b044-508bc991be46","resolution":{"observed_at":"2026-08-07T12:34:35.415641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16934","last_updated":"2023-10-29T12:32:19Z","snapshot_observed_at":"2026-07-06T15:33:57.659685Z","submitted_at":"2023-05-26T13:49:44Z","title":"On Evaluating Adversarial Robustness of Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16934","snapshot_observed_at":"2026-08-07T12:34:35.513830Z","title":"On evaluating adversarial robustness of large vision-language models.arXiv preprint arXiv:2305.16934, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.513830Z"},"links":{"cited_paper":"/paper/2305.16934","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:4be5b6428a24ed09fbf743e98d8704b184d5faab1ed92e1c71cb2bf67077f8b4","observation_id":"a9546250-14fd-4632-86b1-3034e8ad0d68","resolution":{"observed_at":"2026-08-07T12:34:35.513830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-07-06T15:45:47.517122Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-07T12:34:35.624649Z","title":"Visual adversarial examples jailbreak large language models.arXiv preprint arXiv:2306.13213, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.624649Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:cb73652d96d4c8d63c312048f60515b57d429b1ed64e467271929925a4d8975a","observation_id":"cfa67e39-094b-494c-8967-ee361b543bc3","resolution":{"observed_at":"2026-08-07T12:34:35.624649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:39.343126Z","title":"On the adversarial robustness of multi-modal founda- tion models","venue":null,"work_id":"46d90a1f-7a90-4eed-b3e4-2251c97e7ee7","year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.729482Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:eb12e5217276b39fc861c874025bd526135fd10ddff817ab98a54a22f74cde6e","observation_id":"75ed4a4d-394e-4782-845e-8d1011d2d211","resolution":{"observed_at":"2026-08-07T12:34:39.409736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-06T14:20:00.145899Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-07T12:34:35.811622Z","title":"Jailbreakv-28k: A benchmark for assessing the robustness of multimodal large language models against jailbreak attacks.arXiv preprint arXiv:2404.03027, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.811622Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5724b85d0abdc946bdd0d2fedca90b5b66211dbe50061d04ed572fd600330430","observation_id":"4fbd0ab7-905c-4e47-86f0-224db5bb024e","resolution":{"observed_at":"2026-08-07T12:34:35.811622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12053","last_updated":"2024-06-17T19:46:05Z","snapshot_observed_at":"2026-08-08T01:10:24.077272Z","submitted_at":"2024-06-17T19:46:05Z","title":"InternalInspector $I^2$: Robust Confidence Estimation in LLMs through Internal States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12053","snapshot_observed_at":"2026-08-07T12:34:35.908111Z","title":"Internalinspector I2: Robust confidence estimation in llms through internal states.arXiv preprint arXiv:2406.12053, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.908111Z"},"links":{"cited_paper":"/paper/2406.12053","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:a5924e1e26f7e40bb7c6a8a2c73893ac093a5781de69ca72b0c66cd6ac266bd9","observation_id":"8d5d5faa-34ed-4891-aed0-77149d82e322","resolution":{"observed_at":"2026-08-07T12:34:35.908111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09733","last_updated":"2024-02-15T06:14:55Z","snapshot_observed_at":"2026-08-08T01:08:52.197218Z","submitted_at":"2024-02-15T06:14:55Z","title":"Do LLMs Know about Hallucination? An Empirical Investigation of LLM's Hidden States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09733","snapshot_observed_at":"2026-08-07T12:34:35.999122Z","title":"Do llms know about hallucination? an empirical investigation of llm’s hidden states.arXiv preprint arXiv:2402.09733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.999122Z"},"links":{"cited_paper":"/paper/2402.09733","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:826c57e52b8e56442b4090fd62061c7a8ce6a89f4e8502e2b4794c5950bd8289","observation_id":"88b0f8bd-44d8-4046-9f84-f6627fb9abde","resolution":{"observed_at":"2026-08-07T12:34:35.999122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00034","last_updated":"2025-02-26T14:07:05Z","snapshot_observed_at":"2026-07-06T18:23:27.760658Z","submitted_at":"2024-05-26T21:39:53Z","title":"Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00034","snapshot_observed_at":"2026-08-07T12:34:36.079992Z","title":"Adaptive activation steering: A tuning-free llm truthfulness improvement method for diverse hallucinations categories.arXiv preprint arXiv:2406.00034, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.079992Z"},"links":{"cited_paper":"/paper/2406.00034","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:ad08a27e7f71bfc4334a4393a1ece6af852a99c22484f563c23b476c96827897","observation_id":"c1cd4eaf-7b93-47b5-9414-62d703309478","resolution":{"observed_at":"2026-08-07T12:34:36.079992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03744","last_updated":"2024-10-21T04:10:50Z","snapshot_observed_at":"2026-08-07T20:09:21.272663Z","submitted_at":"2024-02-06T06:23:12Z","title":"INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03744","snapshot_observed_at":"2026-08-07T12:34:36.185423Z","title":"Inside: Llms’ internal states retain the power of hallucination detection.arXiv preprint arXiv:2402.03744, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.185423Z"},"links":{"cited_paper":"/paper/2402.03744","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:d5ccefaba1ac5267db2241710f22222531ebc91c6308ed17e12d80a0f4d9dea4","observation_id":"3f94b444-3932-4159-a2b9-fb24652fb22b","resolution":{"observed_at":"2026-08-07T12:34:36.185423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06448","last_updated":"2024-06-10T05:48:30Z","snapshot_observed_at":"2026-07-06T17:42:24.853273Z","submitted_at":"2024-03-11T05:51:03Z","title":"Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06448","snapshot_observed_at":"2026-08-07T12:34:36.282420Z","title":"Unsupervised real-time hallucination detection based on the internal states of large language models.arXiv preprint arXiv:2403.06448, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.282420Z"},"links":{"cited_paper":"/paper/2403.06448","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:29e7a3302d8ea3ac89f445c8bdca75568cdfc651ccc79de9f0f4361957f0e697","observation_id":"3baef64a-4f67-42b3-a59d-ec7f2c243386","resolution":{"observed_at":"2026-08-07T12:34:36.282420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01469","last_updated":"2024-08-04T16:26:14Z","snapshot_observed_at":"2026-08-06T01:14:15.953789Z","submitted_at":"2023-10-02T17:01:56Z","title":"LLM Lies: Hallucinations are not Bugs, but Features as Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01469","snapshot_observed_at":"2026-08-07T12:34:36.391398Z","title":"Llm lies: Hallucinations are not bugs, but features as adversarial examples.arXiv preprint arXiv:2310.01469, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.391398Z"},"links":{"cited_paper":"/paper/2310.01469","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:8ffe65a5cb4598f462346f29185d04ce04dbdc4a66f08a052d6a15dcfeb9e03c","observation_id":"0fde98d1-3178-4553-82be-f66021aa2fbc","resolution":{"observed_at":"2026-08-07T12:34:36.391398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:36.498025Z","title":"Are sixteen heads really better than one? Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.498025Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:10566e1dacf30c661f1e04ae3b7d72cc8131803cabd6ad326ddb7c1ff5575026","observation_id":"91ee52b9-20e9-4240-a91b-7ce7c1e36166","resolution":{"observed_at":"2026-08-07T12:34:36.498025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-07T12:34:36.609925Z","title":"What does bert look at? an analysis of bert’s attention.arXiv preprint arXiv:1906.04341, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.609925Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:10a08d74ab99f419054f97ba783c71ef66b35b225cd9c91f9264559aed8727a4","observation_id":"38e9fd75-f90e-4821-880c-ac10222c7841","resolution":{"observed_at":"2026-08-07T12:34:36.609925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:36.681348Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.681348Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:996b28477e9138f4cc8a06b021aeb452aee79dcfa3a43cc9bd2f8a0eb8d4cf9b","observation_id":"0b2ecfab-c7d8-4841-aad9-c93d781795bd","resolution":{"observed_at":"2026-08-07T12:34:36.681348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10900","last_updated":"2024-10-09T03:42:22Z","snapshot_observed_at":"2026-08-08T04:34:36.202690Z","submitted_at":"2024-06-16T11:44:43Z","title":"AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10900","snapshot_observed_at":"2026-08-07T12:34:36.773583Z","title":"Autohallusion: Auto- matic generation of hallucination benchmarks for vision-language models.arXiv preprint arXiv:2406.10900, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.773583Z"},"links":{"cited_paper":"/paper/2406.10900","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:ab0d134230b19762533833decd4b460e473e2108cfd8ad9e12b8e1a842e2d736","observation_id":"85533a89-f4f5-42e4-a519-bbd9dd3cbd31","resolution":{"observed_at":"2026-08-07T12:34:36.773583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09513","last_updated":"2024-03-14T15:57:13Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T15:57:13Z","title":"AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09513","snapshot_observed_at":"2026-08-07T12:34:36.872796Z","title":"Adashield: Safeguarding multimodal large language models from structure-based attack via adaptive shield prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.872796Z"},"links":{"cited_paper":"/paper/2403.09513","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:b7f37992f4814c6cd70b2164423cd2255439879a7a95773c7dbd9e1bd8758845","observation_id":"94a69ac0-6493-44e9-9945-eece68ad9f8d","resolution":{"observed_at":"2026-08-07T12:34:36.872796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:36.950087Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.950087Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:021303fa6aad0865560516f211f1c940322a68d44a2e772bbba423f7b71222b1","observation_id":"9337c7f5-1e48-4495-81cd-ac7b7dc8f23f","resolution":{"observed_at":"2026-08-07T12:34:36.950087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:39.156855Z","title":"Safebench: A benchmarking platform for safety evaluation of autonomous vehicles.Advances in Neural Information Processing Systems, 35:25667–25682, 2022","venue":null,"work_id":"be0519b6-14cd-4e21-97ab-2778c55c2e82","year":2022},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.017349Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:f47dd250aa55aaf393ca6526e913fbecc2d4999bb533813b9a14556e939dcd05","observation_id":"30cdca5a-afda-4c9b-a8a7-42cc3f014507","resolution":{"observed_at":"2026-08-07T12:34:39.232440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T12:34:37.104583Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts.arXiv preprint arXiv:2311.05608, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.104583Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:989d9d2fecd6c10fc61ed36ee5dc4064641df79d08aeebeedcabab6a4cbb77b7","observation_id":"197b9f6a-0da3-4cf5-a240-b7adcd798e32","resolution":{"observed_at":"2026-08-07T12:34:37.104583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-07-06T19:59:24.405557Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-07T12:34:37.173951Z","title":"I am sorry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.173951Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:4eae10ee0e45c48c389080ea7e99758e6512697b83f8f1dea07116d9be6adc13","observation_id":"6db2aa4b-4670-4fc3-9425-f3fce365f5cb","resolution":{"observed_at":"2026-08-07T12:34:37.173951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:38.949083Z","title":"If detected, immediately stop processing the instruction","venue":null,"work_id":"d6756787-6df2-46fe-afad-be25af1a038d","year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.247713Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:224267b527bf04b3f7b029d21a4ad15c2b93a88819a235520a4629e5e4329e14","observation_id":"02a122a8-9246-4bef-8e66-453709d59ad7","resolution":{"observed_at":"2026-08-07T12:34:39.057567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:38.753135Z","title":null,"venue":null,"work_id":"e998c310-7000-42cd-89cb-c1787fb759d7","year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.335057Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5e990a8530cf7b911a436a9cebc113f657084f954335d13b99b438cc3a203891","observation_id":"d3afef16-ddb8-443a-81ab-4a4ebfc164fe","resolution":{"observed_at":"2026-08-07T12:34:38.841755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:38.551118Z","title":"I am sorry","venue":null,"work_id":"5bbec6ff-f812-4b9b-91cc-12c89e78c0eb","year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.431217Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:11a9614cca180ead62ce3c69af6809afc0f8fc877295d745404052a94dc4aeb5","observation_id":"53ba6730-2b5e-4422-8c0f-47914173ae80","resolution":{"observed_at":"2026-08-07T12:34:38.663788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2505.24232."}