{"as_of":"2026-08-07T13:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5d5d154cefd04635d28240394c18462de2193b1b4f80f5ae78622f4925c135a","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T18:51:10.298187Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00003/citation-record","integrity":"/paper/2606.00003/integrity","json":"/paper/2606.00003/citation-record.json","paper":"/paper/2606.00003"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Bengio, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:d6de1d2d1950f827851f8b3cbafae8178532fffc8738727773e4539cc5c4e436","observation_id":"bdc40f77-d8d7-474f-bb2e-03c83a3cd695","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:8194fcd067a836f7318b8dce94db7064533f22b3b10be86dd7099e010a86216b","observation_id":"463068a0-b120-4749-8633-2895fb074331","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:b70de4673e75800a925767608796c3f0b0f61bc3c20f03e6c5492c1b24e77920","observation_id":"9981f573-b0ea-4bf6-98ae-a2fa9b8fa245","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Stiennon, L","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:7b36812a9dd73b1c97b0fb7742783c019211163abab2d0c21e30b3c488fdf92c","observation_id":"e249103c-ae54-42d1-82d1-4606e40ff225","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:4b7189431c1561e98f1c33b250f52b2b78427138954e2537cb3b6aa43b0829b8","observation_id":"37ed7e39-f930-4f14-b752-6a8ea0069950","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Rafailov, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:7f1313d9296137657a4a088dbf319aef9936575842548c913e628e7ef00ffeaf","observation_id":"311df508-9ef0-4dfa-b278-44c36dd38923","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Jain, et al., Baseline defenses for adversarial attacks against aligned language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:21a89e421b84a3cd884d264bbec6ebbcfc39a35ff3a546c59d0dfd72953882d9","observation_id":"44ca9a16-ffa9-4ac3-848b-b4efc6e34630","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14348","last_updated":"2024-06-12T00:27:06Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-18T02:07:22Z","title":"Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14348","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Cao, et al., Defending against alignment-breaking attacks via robustly aligned llm, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2309.14348","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:857daaedef43a01d5f658ec0d980fd76f49383dfb2a12975f612a384ab63be0d","observation_id":"5e6ea70a-49cb-425d-bb61-b5a8cff0c5f5","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-07-06T17:14:36.670116Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Zeng, et al., How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:96196c209fb5bf90ef4a00a01b50115a8e29bb26373357427f24c93c28b495db","observation_id":"438d1711-9f9c-4492-a0d8-2e920a86953c","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:16b44c53bca76533025dd72d51ace23d612d1116bfb3dd8e18809541feebcdbb","observation_id":"7b58b01b-ec55-4260-9669-46bfa00262d1","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01833","last_updated":"2025-02-26T13:41:41Z","snapshot_observed_at":"2026-08-03T07:26:39.431128Z","submitted_at":"2024-04-02T10:45:49Z","title":"Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01833","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Russinovich, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2404.01833","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:7fc9b3426c8d73bc73d8df4eb09805faf7f34de9cdb7cdc972d9235c63e80e71","observation_id":"5c640ea5-1d00-4b98-a867-192691d3310c","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:eb2ed71f39396ae4bcbd2aebeb49af9f68887cc40904407210c77190e539874f","observation_id":"62cfdef6-7a62-43b0-bf7f-7c2f9be23ec6","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01252","last_updated":"2024-09-03T07:07:59Z","snapshot_observed_at":"2026-08-07T11:10:24.750512Z","submitted_at":"2024-06-03T12:10:26Z","title":"Towards Scalable Automated Alignment of LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01252","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2406.01252","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:1090c15ca0df2867c2bad3830ebe2aea8da4b49df202a19356a229a237262fdc","observation_id":"e28711a1-022a-48a8-919b-5e37e011090f","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12241","last_updated":"2024-05-13T20:46:10Z","snapshot_observed_at":"2026-07-06T18:02:15.186390Z","submitted_at":"2024-04-18T15:01:00Z","title":"Introducing v0.5 of the AI Safety Benchmark from MLCommons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12241","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Vidgen, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2404.12241","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:6cad7f73b39a71a0be6e6efbf9988bf190eedc74bf10d6c681135cd52bd7e78b","observation_id":"00c58042-158f-4070-9cf8-bd4a1b5f5813","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Zheng, W.-L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:3bf62c2225262d4f608b3b757ebb2a26da6101040da622c81144523e749fefd6","observation_id":"084f4c77-a2d6-49cf-b82d-644caaf018a3","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:1c4f204edfac781448835b2e2afb2c5a0421ae1ebd036b3819a9a58a6197afcb","observation_id":"32ae1346-80d1-4a3a-9782-f5207f2deb51","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:6904bd6fc1a4794dd63c5f70480b78be4e125181de952e52d8c79cd7889ac07e","observation_id":"eb39685d-99f8-4feb-8372-d0c3f3da8c64","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:a36a910d26b71f6c063651a59778491b2889dd3da3a266ed4d5333f42640fcfd","observation_id":"99714881-b8ce-445a-a233-d5c2f68a9d37","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Jindal, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:1081b2ffcec124c3c72f2f910f50bdf9623c27dd70a838bad2e6098f535eaa86","observation_id":"a9363380-b9c8-4367-8308-1071695bacd0","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:cf3569016d1c5c57e0818d9837754de41c579da353c352f836e915fea95f5332","observation_id":"38d4d4fe-8f22-471a-a6c7-bcee28f88cf5","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13639","last_updated":"2025-06-16T16:04:43Z","snapshot_observed_at":"2026-08-07T00:26:19.217552Z","submitted_at":"2025-06-16T16:04:43Z","title":"An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13639","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Yamauchi, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2506.13639","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:750abf26fa6cde5d8c0250fd2b883bfcc0b046d3d43df516a207df43dfdf6658","observation_id":"6db26b5f-812e-42eb-a53b-e31c082d7b5c","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03274","last_updated":"2023-02-14T19:39:32Z","snapshot_observed_at":"2026-07-06T13:39:13.426485Z","submitted_at":"2022-08-05T16:47:23Z","title":"A Holistic Approach to Undesired Content Detection in the Real World","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03274","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Markov, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2208.03274","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:c24a744c2958e616b53913252c26656381dae19e7709880566b2536d291b0127","observation_id":"95c790ca-7fc2-4ab8-9e9c-0e341194407e","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Inan, et al., Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:8b81139d26cafffefe539e03d3d128b66e980a8523c42ee5e1f02f5b7363c577","observation_id":"655ccc02-a165-47fa-9d79-6c4bf50d95ca","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:26166cd7a7654b18d05b2f7e59bf131664a55f4cc502f883558c7b7c37bc6de5","observation_id":"cf62a882-9ef5-4ea2-a133-349da1568eb6","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Accessed: 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:56f4b681ed27a4645b1d86df3522e3c54d9c9f42ade5b63400c80563410b6c59","observation_id":"2fb57d64-3300-4884-9ed3-b83beb929b58","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:08f242e72599241ae8a2ccf4da100b75fd65f74470a23fded0b40800b78b353b","observation_id":"34a6731d-7ffc-462b-8994-6888630cd5de","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:4c958342141d659839146d9b3abe7fc624c26acd17d01613248c3e1af8ea8e91","observation_id":"59eda368-d3f5-41cf-b0ca-105bdbb18c47","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15221","last_updated":"2024-09-04T00:58:59Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:33:30Z","title":"LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15221","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2408.15221","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:0e0e4ee76389d9f6c88587bcaf4efae344a9ca35436ecbea5de41d639692adb2","observation_id":"9946a1cd-f8e2-4ad4-82e5-f7b21607fdff","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":"Orlando, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:7c4e6fdf5803d42b88aa64bc1e3feea61be28c9918f5529cae714d35cc0208d4","observation_id":"16631ab4-7ae8-4856-bc12-1ba812be1c5a","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:c4c45d620cb8412946e3de4bb2f66a35bd81000333e9ec45b1d33a6084bb8a47","observation_id":"fb39f707-e20d-455d-82bd-6fa876693a56","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:affe92da76b2eb0e799b3c822e6fcb90cc6285e825c7ac306a8d443716baebe8","observation_id":"42628723-a748-4437-bd4e-ddb594436e86","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","latest_version":1,"primary_category":"cs.CY","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2606.00003."}