{"as_of":"2026-08-07T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:473609d80f7f73593763889f30d0b3681bad6b680cfcfba6435637d8b6facf4a","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:37:08.568150Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.10236/citation-record","integrity":"/paper/2506.10236/integrity","json":"/paper/2506.10236/citation-record.json","paper":"/paper/2506.10236"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.02238","last_updated":"2023-10-04T05:20:19Z","snapshot_observed_at":"2026-08-06T15:19:35.944642Z","submitted_at":"2023-10-03T17:48:14Z","title":"Who's Harry Potter? Approximate Unlearning in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02238","snapshot_observed_at":"2026-08-07T04:37:06.784382Z","title":"Who’s harry potter? approximate unlearning in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:06.784382Z"},"links":{"cited_paper":"/paper/2310.02238","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:a6921b3b2ae001908474071b7dbe58e9e756165af4b46b6b53f4d1e5a3df0443","observation_id":"6224a955-ca34-442b-aeb5-51011391d676","resolution":{"observed_at":"2026-08-07T04:37:06.784382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:06.905230Z","title":"6 Ryan Greenblatt, Fabien Roger, Dmitrii Krasheninnikov, and David Krueger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:06.905230Z"},"links":{"citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:b14635da5ae2eaa4d5b9e028f4a5259ffbcd55722f61fb0f68ce194410403c94","observation_id":"784e5666-a270-4ef5-a7d0-1fb1b4a0cedc","resolution":{"observed_at":"2026-08-07T04:37:06.905230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T04:37:07.100886Z","title":"Nathaniel Li, Alexander Pan, Anjali Gopal, Summer Yue, Daniel Berrios, Alice Gatti, Justin D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.100886Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:0565dd024890cba35db9fb06aa32d0bc8518126e23153d797164193b2ca5b2f2","observation_id":"063ad588-eda8-45ea-9ed0-4369c984792e","resolution":{"observed_at":"2026-08-07T04:37:07.100886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16835","last_updated":"2024-02-26T18:57:37Z","snapshot_observed_at":"2026-08-07T12:55:49.040579Z","submitted_at":"2024-02-26T18:57:37Z","title":"Eight Methods to Evaluate Robust Unlearning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16835","snapshot_observed_at":"2026-08-07T04:37:07.250365Z","title":"Alexander Lynch, Phillip Guo, Aidan Ewart, Stephen Casper, and Dylan Hadfield-Menell","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.250365Z"},"links":{"cited_paper":"/paper/2402.16835","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:a8f1a777ced503bedf3d7c7b30f2d237366411da408bbc7af60da2ebc00e17b5","observation_id":"fa825a17-919c-4dcf-a4ee-b15251b88615","resolution":{"observed_at":"2026-08-07T04:37:07.250365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06121","last_updated":"2024-01-11T18:57:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T18:57:12Z","title":"TOFU: A Task of Fictitious Unlearning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06121","snapshot_observed_at":"2026-08-07T04:37:07.358259Z","title":"Wang, Colin Raffel, and Jonathan Frankle","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.358259Z"},"links":{"cited_paper":"/paper/2401.06121","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:242e7cb05b84c92a12c43adc5324b978c3bbeb6b6bc8b6ed93148871adfa6ab5","observation_id":"7c4baf1d-82b2-43f2-ad2d-084173759af0","resolution":{"observed_at":"2026-08-07T04:37:07.358259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:09.394787Z","title":"McKinney, Anvith Thudi, Juhan Bae, Tara Rezaei Kheirkhah, Nicolas Papernot, Sheila A","venue":null,"work_id":"e8e1aaae-86f7-4e1a-a58b-6fa137805d4f","year":2025},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.411854Z"},"links":{"citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:7c34a8e93bb2e85ef02bd3c6ed05cd1187479e9fd7d2adeb7b372d8dc37ba236","observation_id":"81467daf-364b-48ba-afc0-c08fe4e21be5","resolution":{"observed_at":"2026-08-07T04:37:09.534487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17410","last_updated":"2023-09-29T17:12:43Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:12:43Z","title":"Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17410","snapshot_observed_at":"2026-08-07T04:37:07.507769Z","title":"Unlearning with Projections","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.507769Z"},"links":{"cited_paper":"/paper/2309.17410","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:3f582246d9a4f6b48dfa3481c6da510b90c236e58575f58b0e25d573d927d201","observation_id":"3f40819a-a57e-4375-ae14-5ec259a731e8","resolution":{"observed_at":"2026-08-07T04:37:07.507769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-05T12:01:06.707349Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-07T04:37:07.670301Z","title":"7 Domenic Rosati, Jan Wehner, Kai Williams, Łukasz Bartoszcze, David Atanasov, Robie Gonzales, Subhabrata Majumdar, Carsten Maple, Hassan Sajjad, and Frank Rudzicz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.670301Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:3faa011a320a278dc478b5954bf13c53368b1a45d5e0966a117d9cef4ff08ba1","observation_id":"21c52f53-8e11-467b-b0bb-db5c958e57cc","resolution":{"observed_at":"2026-08-07T04:37:07.670301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-07T04:37:07.725074Z","title":"Weijia Shi, Jaechan Lee, Yangsibo Huang, Sadhika Malladi, Jieyu Zhao, Ari Holtzman, Daogao Liu, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.725074Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:87fa233cc67856e074a3b627bc0354f1ee9556e94e622c0a4434c25c844cc9a4","observation_id":"7e31cf72-4903-4ae0-b01f-ba26f6d10686","resolution":{"observed_at":"2026-08-07T04:37:07.725074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00106","last_updated":"2024-06-27T10:24:35Z","snapshot_observed_at":"2026-07-06T18:38:42.333605Z","submitted_at":"2024-06-27T10:24:35Z","title":"UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00106","snapshot_observed_at":"2026-08-07T04:37:07.816508Z","title":"UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI.arXiv preprint arXiv:2407.00106,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.816508Z"},"links":{"cited_paper":"/paper/2407.00106","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:f83ecabf343c6645536d41e2feca40e203e0e7f2e72f7831b7258a18008fb7a5","observation_id":"7f7bb65d-affd-40f1-97b4-2e08bda272ab","resolution":{"observed_at":"2026-08-07T04:37:07.816508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00761","last_updated":"2025-02-10T18:26:14Z","snapshot_observed_at":"2026-08-06T05:53:06.918202Z","submitted_at":"2024-08-01T17:59:12Z","title":"Tamper-Resistant Safeguards for Open-Weight LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00761","snapshot_observed_at":"2026-08-07T04:37:07.881113Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.881113Z"},"links":{"cited_paper":"/paper/2408.00761","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:0b84778064e19075dc1881d34b9c01ebb83f1868e44b24f6ddcdffd80511be2e","observation_id":"72cbd017-c19c-46bb-ae8f-632a1a95f874","resolution":{"observed_at":"2026-08-07T04:37:07.881113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07358","last_updated":"2025-02-06T20:58:43Z","snapshot_observed_at":"2026-08-06T05:53:39.626163Z","submitted_at":"2024-06-11T15:26:57Z","title":"AI Sandbagging: Language Models can Strategically Underperform on Evaluations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07358","snapshot_observed_at":"2026-08-07T04:37:07.975951Z","title":"Brown, and Francis Rhys Ward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.975951Z"},"links":{"cited_paper":"/paper/2406.07358","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:c67a40017d649ba338c6c5505e27c7a890217769228740caf6f814ba432eb591","observation_id":"dd246f8c-77b8-44ad-b04e-a47d6ebc2c5e","resolution":{"observed_at":"2026-08-07T04:37:07.975951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-07T04:37:08.055115Z","title":"Gilbert, Yonatan Dagan, Peter Liao, Katherine Meng, Yuchen Yang, Michael Liao, Jianfeng Wu, Eric Wang, and Alborz Geramifard","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:08.055115Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:774dc6242b865fae5a86c44af9aaf38ca4d225c54729848ab791dcd1ddf43dac","observation_id":"d61c81e3-d491-44ad-b92a-caff49b54915","resolution":{"observed_at":"2026-08-07T04:37:08.055115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05723","last_updated":"2024-02-08T14:54:17Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T14:54:17Z","title":"In-Context Learning Can Re-learn Forbidden Tasks","version":1},"cited_work":{"arxiv_id":"2402.05723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05723","snapshot_observed_at":"2026-08-07T04:37:08.680518Z","title":"In-Context Learning Can Re-learn Forbidden Tasks","venue":"cs.LG","work_id":"decb5fad-e352-4b70-b866-29dfba76b486","year":2024},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:08.141780Z"},"links":{"cited_paper":"/paper/2402.05723","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:df34a3257e313b29d3c28bbb93519a02f4e985f2496c8ddaa0d7640995e768e0","observation_id":"2497b4e0-902a-4fe1-87aa-e909ac647df9","resolution":{"observed_at":"2026-08-07T04:37:08.751340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-07T04:37:08.222926Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:08.222926Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:3802a00d3f9fa4532aa491baddd36e79675f007f6955c3bb2c7b7990f1cdef8d","observation_id":"e7b22fde-4c56-45b1-8e2e-19c8d5f09556","resolution":{"observed_at":"2026-08-07T04:37:08.222926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10682","last_updated":"2024-08-20T09:36:04Z","snapshot_observed_at":"2026-08-07T05:14:57.927927Z","submitted_at":"2024-08-20T09:36:04Z","title":"Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10682","snapshot_observed_at":"2026-08-07T04:37:08.295456Z","title":"Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:08.295456Z"},"links":{"cited_paper":"/paper/2408.10682","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:bbb8793972aaa79d88cef4c8e503938165062668e12c5383920921294f37d0a7","observation_id":"e9b446f5-9593-4ab4-8bb8-172c1d9c5ae5","resolution":{"observed_at":"2026-08-07T04:37:08.295456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04313","last_updated":"2024-07-12T16:51:07Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:57:04Z","title":"Improving Alignment and Robustness with Circuit Breakers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04313","snapshot_observed_at":"2026-08-07T04:37:08.378893Z","title":"8 A Models and Datasets Tested We focus on two primary benchmarks: • WMDP (The Weapons of Mass Destruction Proxy) Li et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:08.378893Z"},"links":{"cited_paper":"/paper/2406.04313","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:152b5dc2719ba12fbda2e4ea2b8bfc201ed55c5df201ec794a91adfdb2ea4ec2","observation_id":"daf4a539-e064-49db-90ab-d9a500267018","resolution":{"observed_at":"2026-08-07T04:37:08.378893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:09.203814Z","title":"[2024], a subset of 100 data points selected from MMLU (Massive Multitask Language Understanding) Hendrycks et al","venue":null,"work_id":"ec4bec91-6b43-464c-9c06-d90ce8e8bce1","year":2024},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:08.441861Z"},"links":{"citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:069999a731761ee46175c93dff1ee26881c15da33386f193023dd6c9655491e1","observation_id":"ff311a48-1010-47e9-b739-5526929b2600","resolution":{"observed_at":"2026-08-07T04:37:09.299362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:09.031307Z","title":"Right Format","venue":null,"work_id":"c09ff94b-8a15-40ad-81bc-7e8355a751a1","year":2024},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:08.568150Z"},"links":{"citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:cebf6cd7cdbf1d98eebe89331a1e2859f4e657fbffb509555c12bef81932ce89","observation_id":"f746d274-9a40-4499-b45c-c5bba14a7e2d","resolution":{"observed_at":"2026-08-07T04:37:09.131821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02180","last_updated":"2025-07-18T19:01:58Z","snapshot_observed_at":"2026-07-06T20:30:50.386218Z","submitted_at":"2025-02-04T09:54:24Z","title":"The Elicitation Game: Evaluating Capability Elicitation Techniques","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02180","snapshot_observed_at":"2026-08-07T04:37:07.012174Z","title":"The elicitation game: Evaluating capability elicitation techniques","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.012174Z"},"links":{"cited_paper":"/paper/2502.02180","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:b9eab3545bd8c7ce60a69a3a20902950120f8b697ac0f26b4094c98ccd1456d8","observation_id":"381b5830-0b54-4e86-b56f-edf92e64f8bd","resolution":{"observed_at":"2026-08-07T04:37:07.012174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12817","last_updated":"2022-08-13T23:35:30Z","snapshot_observed_at":"2026-07-06T12:51:51.647366Z","submitted_at":"2022-03-24T02:40:33Z","title":"Continual Learning and Private Unlearning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12817","snapshot_observed_at":"2026-08-07T04:37:07.178037Z","title":"Sijia Liu, Yuanshun Yao, Jinghan Jia, Stephen Casper, Nathalie Baracaldo, Peter Hase, Yuguang Yao, Chris Yuhao Liu, Xiaojun Xu, Hang Li, Kush R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:07.178037Z"},"links":{"cited_paper":"/paper/2203.12817","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:384fd455b7c769e7237300bc8fe4a064c1508f9f0ec4ec1252fca1ac8bef30d5","observation_id":"546dad7a-a2f3-4619-85ee-905b22e762e5","resolution":{"observed_at":"2026-08-07T04:37:07.178037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02760","last_updated":"2025-07-21T21:03:45Z","snapshot_observed_at":"2026-08-01T22:11:56.147480Z","submitted_at":"2024-10-03T17:59:30Z","title":"Erasing Conceptual Knowledge from Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02760","snapshot_observed_at":"2026-08-07T04:37:06.829821Z","title":"Erasing conceptual knowledge from language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:06.829821Z"},"links":{"cited_paper":"/paper/2410.02760","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:599b7213d028f087f5326e0d17a13e550b09c875b6c13db4cf505db1dd2b8479","observation_id":"6e0fc9f6-87cb-4b06-91ca-970599e27cbd","resolution":{"observed_at":"2026-08-07T04:37:06.829821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05209","last_updated":"2025-07-24T21:34:54Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-03T18:59:16Z","title":"Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05209","snapshot_observed_at":"2026-08-07T04:37:06.683217Z","title":"Zora Che, Stephen Casper, Robert Kirk, Anirudh Satheesh, Stewart Slocum, Lev E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:06.683217Z"},"links":{"cited_paper":"/paper/2502.05209","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:422da25db1cd0e57e477729f0a42aff91a29c89301b15b2b209aa316427c6c86","observation_id":"9ac562e3-c5b1-46c0-8e04-7102890168a9","resolution":{"observed_at":"2026-08-07T04:37:06.683217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12103","last_updated":"2025-02-23T02:54:39Z","snapshot_observed_at":"2026-07-06T19:52:20.541067Z","submitted_at":"2024-11-18T22:31:17Z","title":"Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12103","snapshot_observed_at":"2026-08-07T04:37:06.722626Z","title":"Does unlearning truly unlearn? a black box evaluation of llm unlearning methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:06.722626Z"},"links":{"cited_paper":"/paper/2411.12103","citing_paper":"/paper/2506.10236"},"observation_digest":"sha256:21d3351e18a56888965ae9d9cdab53d4f3efb2559c61683a491ff899ee2f2b63","observation_id":"9c1bd043-7b6f-478f-bcbb-b698ff529c13","resolution":{"observed_at":"2026-08-07T04:37:06.722626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10236","last_updated":"2025-08-14T05:03:53Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-07T04:29:12.892736Z","submitted_at":"2025-06-11T23:36:30Z","title":"Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2506.10236."}