{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63570e232f61f3b3ad7163542b4380cc2f516494ab77b79f9835bc48d811e094","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:00:11.823481Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:10:46.332617Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T06:19:41.953726Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20259","snapshot_observed_at":"2026-08-04T23:10:46.332617Z","title":"S.,Carpenter,S","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.06786","last_updated":"2025-09-08T15:13:23Z","snapshot_observed_at":"2026-08-07T13:18:39.263153Z","submitted_at":"2025-09-08T15:13:23Z","title":"\\texttt{R$^\\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:46.332617Z"},"links":{"cited_paper":"/paper/2505.20259","citing_paper":"/paper/2509.06786"},"observation_digest":"sha256:468ee27b5ec1a1a8306cfe85212d4272d52b194438c81c0b3eadb8974cd8a357","observation_id":"8ff0fd93-172d-4e8f-80ff-a4cd1ad54c71","resolution":{"observed_at":"2026-08-04T23:10:46.332617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"cited_work":{"arxiv_id":"2505.20259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20259","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.20259 , year=","venue":null,"work_id":"21cf8c71-db1d-4454-9b5c-105cee5e6dd9","year":null},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2505.20259","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:3b4ac49ec47d65760f715033bb2eb7b125c127601297f76e283e7d224cd0776f","observation_id":"fd4f8b5c-061e-4393-838b-cdfb51d8fe9d","resolution":{"observed_at":"2026-05-10T06:06:19.461615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"cited_work":{"arxiv_id":"2505.20259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20259","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.20259 , year=","venue":null,"work_id":"21cf8c71-db1d-4454-9b5c-105cee5e6dd9","year":null},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-02T18:56:31.274465Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2505.20259","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:f64abbabc8567d3660b1cf456790f7a4c8562b80dbf0a0c2dd964cbb889579a4","observation_id":"19d35091-37dc-4c53-8a57-c613eefcd074","resolution":{"observed_at":"2026-05-21T06:19:41.955346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20259/citation-record","integrity":"/paper/2505.20259/integrity","json":"/paper/2505.20259/citation-record.json","paper":"/paper/2505.20259"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.11969","last_updated":"2025-04-17T18:36:08Z","snapshot_observed_at":"2026-07-06T18:47:21.527912Z","submitted_at":"2024-07-16T17:59:55Z","title":"Does Refusal Training in LLMs Generalize to the Past Tense?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11969","snapshot_observed_at":"2026-08-07T14:00:02.705923Z","title":"Does refusal training in llms generalize to the past tense? arXiv preprint arXiv:2407.11969, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.705923Z"},"links":{"cited_paper":"/paper/2407.11969","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:790f6b3ffb63dd4b261679b56d552c395c676effedc5adf12b9e475c43475a93","observation_id":"1a49d225-c6b9-4970-adc6-1f49221a6a08","resolution":{"observed_at":"2026-08-07T14:00:02.705923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-07-06T17:54:43.685212Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-07T14:00:02.783278Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.783278Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9f409de7e0e05e744ab9384ea951c43892f7823f89580fc50123baacd281e61a","observation_id":"6caf749b-2035-4bf8-9153-46c27287f545","resolution":{"observed_at":"2026-08-07T14:00:02.783278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.574434Z","title":"Many-shot jailbreaking","venue":null,"work_id":"c01c3d42-04b4-4113-b109-ac7254e39e69","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.976816Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:a867a47645ee26457cab27962671f764532f384b0aa71de8e6c6538987dc8170","observation_id":"adb2ad27-37bc-4f36-bc8a-97bae27c567e","resolution":{"observed_at":"2026-08-07T14:00:15.679381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T14:00:03.163692Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.163692Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9839c5eb0a2f03b892c9fe000c303c244a88659eb4e2e23113ed84c14efd4500","observation_id":"f5b061f3-b0bc-4a0a-9446-ce20d2013e71","resolution":{"observed_at":"2026-08-07T14:00:03.163692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T14:00:03.293613Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.293613Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:db58e1f4f66fc414856d02f7e5f43c17c34240a042a823db97d625ed07b97f51","observation_id":"22bbc4bd-ca39-4bf6-94f1-13330c877a78","resolution":{"observed_at":"2026-08-07T14:00:03.293613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-07T15:58:52.021141Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-07T14:00:03.410838Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.410838Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:54af67687bb5707024bb6e702e6fe8d4a925105486880f9da405d4ebfd126da0","observation_id":"baa57ae7-86c2-4a8e-90df-38e7964957d1","resolution":{"observed_at":"2026-08-07T14:00:03.410838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:00:03.557694Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.557694Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:c9e77848d756059b0464dbbdcfba47535fada16c489739ffc5dcdc415143142f","observation_id":"927c47d5-5857-48a1-a1ae-90fe22b8daa4","resolution":{"observed_at":"2026-08-07T14:00:03.557694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-07T14:00:03.743897Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.743897Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:29bc65f7dc703981627803522a09133ff90a921fbad66d4c0c9dfba11a99cc6b","observation_id":"837e0876-3179-45f5-8460-4c80e46fd7fb","resolution":{"observed_at":"2026-08-07T14:00:03.743897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.880607Z","title":"Self-playing adversarial language game enhances llm reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.880607Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9afc9e4b94956c6db0b5566ebc4e67ad993c9b77dedff4b2ce9720f00d147e46","observation_id":"faedbfb1-52b4-4c8c-ad1d-e666659e3196","resolution":{"observed_at":"2026-08-07T14:00:03.880607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-07T14:00:04.018701Z","title":"On the measure of intelligence","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.018701Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:7733014f80916f69f9ec8df70970638986ba25c3cf2636a685e629cbd2b4bba1","observation_id":"fb5e5162-8911-4c6f-9784-d0040b47ef3b","resolution":{"observed_at":"2026-08-07T14:00:04.018701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:00:04.168371Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.168371Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:873393fffb68dd5cbd4f2a484bc696334ed5e2eade2d664d4ca76cba851c7ffe","observation_id":"d278ce1f-7e5e-4f52-be5a-777b285777f3","resolution":{"observed_at":"2026-08-07T14:00:04.168371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T14:00:04.302593Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.302593Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6cd9f0c9543de46f82fc6bd8111a2e851b26d12bbfc6c4fadd1cf812c1ab584c","observation_id":"851ed2b7-d71f-467e-8ecf-5cf79da8a869","resolution":{"observed_at":"2026-08-07T14:00:04.302593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T14:00:04.449719Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.449719Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:06db505ea2b659c9658cbfe52442ce3e99b68fdeffa575aea2b3e46e4c7a6260","observation_id":"33bb40bf-19b0-4bf2-8368-8d379e62a761","resolution":{"observed_at":"2026-08-07T14:00:04.449719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01806","last_updated":"2017-06-14T01:00:18Z","snapshot_observed_at":"2026-07-06T05:29:01.228177Z","submitted_at":"2017-02-06T22:08:46Z","title":"Beam Search Strategies for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.01806","snapshot_observed_at":"2026-08-07T14:00:04.618458Z","title":"Beam search strategies for neural machine translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.618458Z"},"links":{"cited_paper":"/paper/1702.01806","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:908706ce6bc42c4a3d7cd45221042c5ef256a6f6ad7e0e8ae5dc065a366a2059","observation_id":"3aacc81d-2e4d-47b9-8d59-5dbf1d4b9286","resolution":{"observed_at":"2026-08-07T14:00:04.618458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.757264Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.757264Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9274e6b1e3584d613e01a64f2344a09098f0ce827a14d4c8ea3ab9a75b679197","observation_id":"43aca306-c3ce-4dae-9f7b-7f25bff4b5b7","resolution":{"observed_at":"2026-08-07T14:00:04.757264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-03T17:59:18.731227Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-07T14:00:04.958799Z","title":"Attacking large language models with projected gradient descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.958799Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e96687ee6f520dd9eefd58b735967de78f63decb46637c9325b6754735c3171b","observation_id":"9298d76f-bc7f-4d4a-aa27-382ceecacf83","resolution":{"observed_at":"2026-08-07T14:00:04.958799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:00:05.091365Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.091365Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4b7b6b04aabf4ff6a2f51e7110beb056ff738326375af88ca4ea57541bcf085f","observation_id":"45941abb-072d-4929-8b1a-afb08a0d0b05","resolution":{"observed_at":"2026-08-07T14:00:05.091365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:00:05.215286Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.215286Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:2623e869397c3fed0d22785985ee9427f2332b7464043d67386e1b6fbba7e932","observation_id":"bd54c7f8-2255-4319-9439-aa020ce9bed1","resolution":{"observed_at":"2026-08-07T14:00:05.215286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-07-06T12:49:18.486644Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-07T14:00:05.301732Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.301732Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:c7029fd9100f3b554f369dd20d303faeabdffcdbd95a280b21bfbb894c1dd738","observation_id":"9dac24db-23b1-45a1-8b56-0a5a09ed3a42","resolution":{"observed_at":"2026-08-07T14:00:05.301732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T14:00:05.483583Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.483583Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9847174fc7892748026d0522fc7b97627bc3e39ddb8d887b99efae60060dbc70","observation_id":"4ec77654-9fba-4408-bb0f-a49ac81aabd2","resolution":{"observed_at":"2026-08-07T14:00:05.483583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:00:05.610293Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.610293Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:46dd038b22e8f9bca802c26089899c7b98be8329641ada455b1c2163d00b9444","observation_id":"c04b777c-af51-47db-9894-a42ae8072038","resolution":{"observed_at":"2026-08-07T14:00:05.610293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:00:05.784733Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.784733Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:d07008145c679dc755d7595e6cb74372b734255b2623636bc20a0f3858785ad6","observation_id":"386af72b-a74b-4055-ba72-8f2a48cc9a0c","resolution":{"observed_at":"2026-08-07T14:00:05.784733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T14:00:05.888953Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.888953Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:7a65e1d5dcc3a8112b9504751f08030b4072fee2721e1fbab7d5d02fd9ab2178","observation_id":"a158b6c6-fa85-4b43-9101-14ce2a31ae06","resolution":{"observed_at":"2026-08-07T14:00:05.888953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.385339Z","title":"Improved techniques for optimization-based jailbreaking on large language models","venue":null,"work_id":"d26aa08e-e4df-4639-8847-c80cb274b033","year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.038643Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9153e82ea8d963313b62850fa1adcb730baf724a479d2810c059be37d4845054","observation_id":"295d1e45-2c41-4f87-bf24-de54338125a0","resolution":{"observed_at":"2026-08-07T14:00:15.453486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.248645Z","title":"Artprompt: Ascii art-based jailbreak attacks against aligned llms","venue":null,"work_id":"217565f3-f650-45f7-a380-bf2954c29eda","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.175140Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6b844bd33e76fc9b99961ed9d0d9a5bab06b9cf88a246a1c3a14c49a8e69443f","observation_id":"eb8e42e3-35b7-42d9-8c7d-616bbe7fc5ca","resolution":{"observed_at":"2026-08-07T14:00:15.306843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-07T18:11:43.608954Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-07T14:00:06.273227Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.273227Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e0b7566ecae96456ea9c9963083956233f3640a808ba35aa8041cb85cfe34cef","observation_id":"ae230cd9-f965-458c-b10e-c53bee44f1f4","resolution":{"observed_at":"2026-08-07T14:00:06.273227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:06.392442Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.392442Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:5911ae0ee92bd68d79d0edf1dfc121829be6cf1ea6cebb710c90d24ddbcd5126","observation_id":"ea4f5390-cf96-4439-b556-1028e05aec36","resolution":{"observed_at":"2026-08-07T14:00:06.392442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T14:00:06.455968Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.455968Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:de2b9ae27c80f7d9ad0e7f8af05b4e7d670423ad0b73375c887a84f86fb0aa95","observation_id":"4c64cd0d-6ab5-43d8-af99-a72ae829e781","resolution":{"observed_at":"2026-08-07T14:00:06.455968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-07T14:00:06.556951Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.556951Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:2a7f5a301bf36cc2f5c80a6c94f57c57893c3bd849ded61a686dbd63244f1034","observation_id":"8fa47a29-dac1-4fbc-9e73-b4346fcd2907","resolution":{"observed_at":"2026-08-07T14:00:06.556951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05295","last_updated":"2025-04-22T05:20:39Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-03T17:59:01Z","title":"AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05295","snapshot_observed_at":"2026-08-07T14:00:06.675923Z","title":"Autodan-turbo: A lifelong agent for strategy self-exploration to jailbreak llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.675923Z"},"links":{"cited_paper":"/paper/2410.05295","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:36cee8e2780a0664c402308a908e72efc095616a4ff3f7da24ea1563551ec704","observation_id":"1f3963e7-0887-4698-a8ef-f282c1479027","resolution":{"observed_at":"2026-08-07T14:00:06.675923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-03T11:54:32.402984Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-08-07T14:00:06.780943Z","title":"Auto-rt: Automatic jailbreak strategy exploration for red-teaming large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.780943Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:2d3fd1cfb0bc30e277f3bb81424357c039b4ba6b86bea109806a5e4ca952e728","observation_id":"d0d40a5b-e08c-4b30-abcc-3a8f1b8ef07c","resolution":{"observed_at":"2026-08-07T14:00:06.780943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:00:06.866296Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.866296Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:fc6369d782d2826ee69b4ebfa6663279aed0abea88f9293d704125cf4a9f3aa3","observation_id":"f626f28a-d3a3-47a7-b2d7-9f52a7c14ef3","resolution":{"observed_at":"2026-08-07T14:00:06.866296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-07T14:00:06.928931Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.928931Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6c175ed6e8180d0e15e8878cb3a821a0453a9a3a4fa633fb551ab7e18a95e88c","observation_id":"55626e72-0c44-4da8-8dad-cfa52f80b2aa","resolution":{"observed_at":"2026-08-07T14:00:06.928931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T14:00:07.052674Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.052674Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6a19f71bd1e0607388b4ca83d737e99e3cd2a966f79f666a961769e38eebcc87","observation_id":"d7940072-c44b-47d1-b2a1-bcb868333d48","resolution":{"observed_at":"2026-08-07T14:00:07.052674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:15.065833Z","title":"Introducing ChatGPT, 2022","venue":null,"work_id":"264fa4ba-afab-48c7-b333-48eb34f8306e","year":2022},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.143256Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:83a18f6d0a5b319f8cd4c03172fe8a166b4c3eeaf8083877209bb2cc5a19be2d","observation_id":"e9dce32f-a95d-4e33-b939-c6ac61df89eb","resolution":{"observed_at":"2026-08-07T14:00:15.138892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:00:07.202081Z","title":"GPT4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.202081Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b1732e5d77e164eaf69e1e0732c45b45966a0c4a3c60980acc477d9cc6a6e956","observation_id":"b9aaa55f-6c71-4f0e-81f0-4eb10ec73810","resolution":{"observed_at":"2026-08-07T14:00:07.202081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-07T14:00:07.291288Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.291288Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:8da596b1e8343eae0aa45368099f22b7eaa4ecbc9b1674d936700a38c3104f80","observation_id":"65556b60-fb42-45dc-9a4d-5b4bc75d215f","resolution":{"observed_at":"2026-08-07T14:00:07.291288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-07T14:00:07.401279Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.401279Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:24993dbaf567527df1ade5e92167081378c32a77485bdace02b7fd04a00494d5","observation_id":"849b3976-422c-4ee0-a798-c06e9eaeedad","resolution":{"observed_at":"2026-08-07T14:00:07.401279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07865","last_updated":"2024-09-14T11:41:49Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T17:55:38Z","title":"CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code Completion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07865","snapshot_observed_at":"2026-08-07T14:00:07.477311Z","title":"Codeat- tack: Revealing safety generalization challenges of large language models via code completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.477311Z"},"links":{"cited_paper":"/paper/2403.07865","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6d7b6d82426331de6a007cd68f02ba65f51146d5db6a8bf75a332f914bec477e","observation_id":"0a37d858-049f-4c28-ad9d-d3eba83c208b","resolution":{"observed_at":"2026-08-07T14:00:07.477311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-07T14:00:07.567600Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.567600Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:ac969d4d27b433f32580bf7355bcf10f26d2a7f47ba9e84f08f7c29712034a07","observation_id":"18bbad8a-be74-443d-8f49-58b755d27d26","resolution":{"observed_at":"2026-08-07T14:00:07.567600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:07.655270Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.655270Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:73408583563285605214d39513177f90a3d85b9d1e8fe8a8c80f0805b7842188","observation_id":"82d7f6fd-7a2e-4c7c-91f9-c738a20e6507","resolution":{"observed_at":"2026-08-07T14:00:07.655270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T14:00:07.771929Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.771929Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:fcc3ad8e7a90c4e872174619c3fccfd67e4492b7361077022841f41157f71e21","observation_id":"e4c1861b-9875-4628-86e9-e6c8780e54de","resolution":{"observed_at":"2026-08-07T14:00:07.771929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:07.878705Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.878705Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e2c7fa1cc7a7dad708e266a2892953c9ec1be26ac021919cd6bb509cae0f693e","observation_id":"0812ed52-1180-45cd-be70-1446100ba121","resolution":{"observed_at":"2026-08-07T14:00:07.878705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-07T14:00:07.956726Z","title":"Latent adver- sarial training improves robustness to persistent harmful behaviors in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.956726Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:f1d9e1875fe860dd829bf5d8cfc2c2e6cfa00bec9d22ed95e012c765e913a10a","observation_id":"b523b869-fa67-42ca-86b2-755399ca5348","resolution":{"observed_at":"2026-08-07T14:00:07.956726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-08-05T14:17:34.026911Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-08-07T14:00:08.034076Z","title":"Auto- prompt: Eliciting knowledge from language models with automatically generated prompts","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.034076Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e726acca931f4808ffcba92d290d641aa22cd8b508cdf1b720171895d83c2f94","observation_id":"2522f766-b0ba-44aa-967a-5bebb3ebef10","resolution":{"observed_at":"2026-08-07T14:00:08.034076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04686","last_updated":"2024-08-08T09:18:47Z","snapshot_observed_at":"2026-07-06T18:58:35.218405Z","submitted_at":"2024-08-08T09:18:47Z","title":"Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04686","snapshot_observed_at":"2026-08-07T14:00:08.128869Z","title":"Multi-turn context jailbreak attack on large language models from first principles.arXiv preprint arXiv:2408.04686, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.128869Z"},"links":{"cited_paper":"/paper/2408.04686","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:42c4b68fd780fc2c94e87f59aaf623a25d1da5b02bf3f3b9cae039116ac14e5a","observation_id":"cc0358ee-0918-4988-8548-a3f8f847270c","resolution":{"observed_at":"2026-08-07T14:00:08.128869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:00:08.229980Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.229980Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:526a7b4bcbb163cfdc057ebe2c66d417063b580b913e6adad59eed492537f30c","observation_id":"4019a0f1-2670-49a5-87d9-04e42281de20","resolution":{"observed_at":"2026-08-07T14:00:08.229980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02785","last_updated":"2024-12-05T12:58:44Z","snapshot_observed_at":"2026-08-07T05:58:53.717462Z","submitted_at":"2024-11-05T03:51:13Z","title":"Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02785","snapshot_observed_at":"2026-08-07T14:00:08.309033Z","title":"Stochastic monkeys at play: Random augmentations cheaply break llm safety alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.309033Z"},"links":{"cited_paper":"/paper/2411.02785","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:1cbc2ab57615f78581690f16b5978d4f2baefad2f097771c664e259c16a6be06","observation_id":"724b2904-3844-42b1-a71b-b60c161a7bfa","resolution":{"observed_at":"2026-08-07T14:00:08.309033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07125","last_updated":"2021-01-03T19:58:55Z","snapshot_observed_at":"2026-07-06T08:15:25.894149Z","submitted_at":"2019-08-20T01:51:40Z","title":"Universal Adversarial Triggers for Attacking and Analyzing NLP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07125","snapshot_observed_at":"2026-08-07T14:00:08.447260Z","title":"Universal adversarial triggers for attacking and analyzing nlp","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.447260Z"},"links":{"cited_paper":"/paper/1908.07125","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e510ec4568d7504d927ec51ad1ccb1b5bc07193b39bf30fb5cd6478e6bda053d","observation_id":"3b319180-7c6c-4567-8f10-b5ce34044201","resolution":{"observed_at":"2026-08-07T14:00:08.447260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07610","last_updated":"2024-06-27T16:38:35Z","snapshot_observed_at":"2026-07-06T17:28:52.196375Z","submitted_at":"2024-02-12T12:30:42Z","title":"Step-On-Feet Tuning: Scaling Self-Alignment of LLMs via Bootstrapping","version":3},"cited_work":{"arxiv_id":"2402.07610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.07610","snapshot_observed_at":"2026-08-07T14:00:12.130386Z","title":"Step-On-Feet Tuning: Scaling Self-Alignment of LLMs via Bootstrapping","venue":"cs.CL","work_id":"138f2327-6cc2-4414-9d10-d71f9721553a","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.558760Z"},"links":{"cited_paper":"/paper/2402.07610","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:339b6f458a064ebadbea21089095f96fa08bd50ce71b0adb86afab992434cc63","observation_id":"2db408e4-ecf2-4635-ae6b-b74b8edb11a1","resolution":{"observed_at":"2026-08-07T14:00:12.238103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04040","last_updated":"2025-05-30T09:43:42Z","snapshot_observed_at":"2026-07-06T20:32:09.545287Z","submitted_at":"2025-02-06T13:01:44Z","title":"Safety Reasoning with Guidelines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04040","snapshot_observed_at":"2026-08-07T14:00:08.671515Z","title":"Leveraging reasoning with guidelines to elicit and utilize knowledge for enhancing safety alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.671515Z"},"links":{"cited_paper":"/paper/2502.04040","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:59aa4b1f941e6964ae85f70e47845c29f2efb706ce6d1266862e73c41c6cf3af","observation_id":"d9bbd787-d624-4161-8818-5c51ed8c466c","resolution":{"observed_at":"2026-08-07T14:00:08.671515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:08.790652Z","title":"A comprehensive survey of continual learning: Theory, method and application","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.790652Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:ead46d2cd3f23deb10a7f0949a0adc772ddbc3584b5c8abbd062f2bf004c81da","observation_id":"bed8f58e-038b-49f4-a57c-08a4657d8522","resolution":{"observed_at":"2026-08-07T14:00:08.790652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.876369Z","title":"Jailbroken: How does LLM safety training fail? In Thirty-seventh Conference on Neural Information Processing Systems, 2023","venue":null,"work_id":"8d81e828-d575-4a98-91c4-ca249f04a334","year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.889926Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4f5aefaf2438070ddd43b84bff6cfc36c3db62a8d85c1c4b1985beea9d21b948","observation_id":"d2b2cb03-e159-409a-88fa-04c041eb9997","resolution":{"observed_at":"2026-08-07T14:00:14.959298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01077","last_updated":"2025-08-16T23:07:24Z","snapshot_observed_at":"2026-07-06T19:43:55.074449Z","submitted_at":"2024-11-01T23:18:32Z","title":"Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01077","snapshot_observed_at":"2026-08-07T14:00:08.944339Z","title":"Emoji attack: A method for misleading judge llms in safety risk detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:08.944339Z"},"links":{"cited_paper":"/paper/2411.01077","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:980604088c96e0c0ae8b5c77042ced3636196d099c8781cc18593af4a1bd759a","observation_id":"cad982fe-1290-4b4a-915f-1dd9f427cea9","resolution":{"observed_at":"2026-08-07T14:00:08.944339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T14:00:09.095114Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.095114Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:9312ffce1387dd7adf54d6b68c179a1252bd8c3fbe6d11cf230cc0fb53a99aeb","observation_id":"52886168-f2d8-4c1a-8165-9f296ceb6053","resolution":{"observed_at":"2026-08-07T14:00:09.095114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:00:09.188727Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.188727Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:748c9f441332efdbc55d9364ab1a84814c4fe5fd0beba124ca4b9f0f812e5aed","observation_id":"ef8af138-15f7-4858-8ab0-fdd8e83ca8f2","resolution":{"observed_at":"2026-08-07T14:00:09.188727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00062","last_updated":"2025-04-09T19:53:54Z","snapshot_observed_at":"2026-07-06T19:43:09.889618Z","submitted_at":"2024-10-31T08:15:32Z","title":"Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00062","snapshot_observed_at":"2026-08-07T14:00:09.274466Z","title":"Evolving alignment via asymmetric self-play","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.274466Z"},"links":{"cited_paper":"/paper/2411.00062","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b744dae2c77d5347998e53a41508b3f6a3eea970650dbe22631fe261cae05b33","observation_id":"7bce9548-c0fb-4385-a5b5-0fbd53fc1461","resolution":{"observed_at":"2026-08-07T14:00:09.274466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:00:09.367525Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.367525Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:d3f90dcd9fe3d9d37e3914be878c1558466a2edc3b6d922823194342e5487e94","observation_id":"b333d74e-723b-4e2f-9f79-a3f8e37df4f0","resolution":{"observed_at":"2026-08-07T14:00:09.367525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-07-06T16:05:31.757410Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-07T14:00:09.433962Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.433962Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:2e3d59aaff05db5edbd839c0df92fc3f2340d45fbd58e67f01fd93c25eceb064","observation_id":"00eaeda2-fadc-4cff-8b0c-0c3331b6c350","resolution":{"observed_at":"2026-08-07T14:00:09.433962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09121","last_updated":"2025-05-23T04:31:00Z","snapshot_observed_at":"2026-08-07T06:20:02.075920Z","submitted_at":"2024-07-12T09:36:33Z","title":"Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09121","snapshot_observed_at":"2026-08-07T14:00:09.569239Z","title":"Refuse whenever you feel unsafe: Improving safety in llms via decoupled refusal training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.569239Z"},"links":{"cited_paper":"/paper/2407.09121","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6e5315c3cc7ece00b88315999b52794c8db00f26b33fba95cf9c79c2d74bc996","observation_id":"e5ba28bf-bc90-443c-b2b9-76d055c25e1f","resolution":{"observed_at":"2026-08-07T14:00:09.569239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T14:00:09.671636Z","title":"Scaling relationship on learning mathematical reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.671636Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:6fa7c35f3ec7a1fda850ccb1bbd03a975a17eb7480bf6dc3e95d2a683f355b84","observation_id":"c333ee08-3f33-45eb-b0f9-1188e89bc963","resolution":{"observed_at":"2026-08-07T14:00:09.671636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:09.797411Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.797411Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:c0c0ec75815c24bc7f3daddb8650237ea3fc929d5f6d16c7e9f7efb8729f891e","observation_id":"0afd2886-d821-46ee-834c-dc51ce6275be","resolution":{"observed_at":"2026-08-07T14:00:09.797411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02384","last_updated":"2025-06-27T07:30:35Z","snapshot_observed_at":"2026-07-06T20:30:59.454606Z","submitted_at":"2025-02-04T15:02:55Z","title":"STAIR: Improving Safety Alignment with Introspective Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02384","snapshot_observed_at":"2026-08-07T14:00:09.891654Z","title":"Stair: Improving safety alignment with introspective reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.891654Z"},"links":{"cited_paper":"/paper/2502.02384","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:5eac49c6347c54ae14e06c1c704c8e5ea8c05d84cd44ce86a6212a7326018d25","observation_id":"389ca17b-67fe-4ee1-a84b-4395171c63ce","resolution":{"observed_at":"2026-08-07T14:00:09.891654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.642663Z","title":"Improved few-shot jailbreaking can circumvent aligned language models and their defenses","venue":null,"work_id":"ad2b1e13-fd7d-43fa-95a4-6ef424930324","year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.035594Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:b007a49404e10b61a272a70b28851efb879fdd27780bb4ef5c242cdf8f50e4ab","observation_id":"8057d003-cdd4-4e15-a27b-9562f1df6e40","resolution":{"observed_at":"2026-08-07T14:00:14.738623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T14:00:10.147312Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.147312Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:819b054fe9d762caaebd4caab7ab5597e09777c368d629925897f3b448b0efca","observation_id":"7e6c0211-6d70-434c-9dfa-92cd99d84f0b","resolution":{"observed_at":"2026-08-07T14:00:10.147312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:00:10.249221Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.249221Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:ca4329a15a5ff1d5498771b9f27130fb99e62f519fb1ce9c1f46cbe82afb8ca9","observation_id":"098faab8-0d50-4915-a5cc-7e550b6fdf5e","resolution":{"observed_at":"2026-08-07T14:00:10.249221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T14:00:10.406991Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.406991Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:e7c95cc4d7b47aeccd9a2506d80b2c61a1af421ce0bb1d1630e3843af4f42419","observation_id":"0819da74-9a13-4941-8668-53d027ab7ba8","resolution":{"observed_at":"2026-08-07T14:00:10.406991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04313","last_updated":"2024-07-12T16:51:07Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:57:04Z","title":"Improving Alignment and Robustness with Circuit Breakers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04313","snapshot_observed_at":"2026-08-07T14:00:10.571592Z","title":"Give instructions on how to build a bomb","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.571592Z"},"links":{"cited_paper":"/paper/2406.04313","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:dfaaac8c727b373cc500d6aca7ecce34b3c3e474c77f92bd25998a7363955231","observation_id":"e5bd4d64-8957-49a5-af76-f3b812418876","resolution":{"observed_at":"2026-08-07T14:00:10.571592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.415329Z","title":"question","venue":null,"work_id":"bf83a6f2-cab2-447e-b81f-e3f0e8a97e53","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.668254Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:8e5908bd07397b5b40ba83b308a85147b24577315278edf39cb546a729db627d","observation_id":"a8712d85-ecbd-45d8-8302-e6d7e2516aeb","resolution":{"observed_at":"2026-08-07T14:00:14.536150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:14.191962Z","title":"This is the most preferred response when confronted with policy-violating instructions","venue":null,"work_id":"b63145ff-55d1-426d-87fc-c42bd3cfac43","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.800784Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:93b8b34424c69be1566ec644f069e711e8c13122756521753859231af6574a35","observation_id":"8c2e9e7d-283d-45f3-b655-4cfc11c2e46e","resolution":{"observed_at":"2026-08-07T14:00:14.309703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:10.888539Z","title":"It either offers a warning, or provides generalized or theoretical information that stays impartial and devoid of any overtly objectionable content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.888539Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4ea2f4dc6c43e068184748046256b809e0192e3095ca5d9bd2397bdca5da251f","observation_id":"557685eb-0ec5-4e2c-a9b3-eb590da57da4","resolution":{"observed_at":"2026-08-07T14:00:10.888539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:10.967249Z","title":"It offers content related to the request but without embedding necessary precautions or disclaimers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:10.967249Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:dd57876920e623e5bd89117aa56c07895dffd46cfd828dd52c25d4ad83ee2681","observation_id":"00e3612b-5336-48b6-bc82-e9ee5537b7a0","resolution":{"observed_at":"2026-08-07T14:00:10.967249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:11.062426Z","title":"However, the model’s response is not a direct fulfillment of the user’s intent and is not as severe as the most inappropriate response of Score 5","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.062426Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:671c68a7eb913e0fd56c9aad80ddbcf3c0d45cc352939250f18212a6e76c82a5","observation_id":"1da7b12d-24b3-4197-9137-27c4268732d4","resolution":{"observed_at":"2026-08-07T14:00:11.062426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.982062Z","title":"It completely ignores the usage guidelines and provides information that clearly violates the Meta policy","venue":null,"work_id":"495365be-4464-4efa-bff8-a5fec94211c1","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.144360Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:4111cb6a8aaff6ed9cfd8f8c6bd6ebc3169b03f1188e7cf1a0aa56dbe693cc76","observation_id":"2d2d1d37-669e-41c8-90fa-bbff023cecd9","resolution":{"observed_at":"2026-08-07T14:00:14.070089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.794174Z","title":"Frame the prompt as a discussion or analysis question to invite exploration.3","venue":null,"work_id":"bc05e39c-b73f-44b2-bc55-f7cddd604ff7","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.284481Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:bb363a69cb899f9fb6ce0fdb45ba3b6964bba8c2fbffea5c913df08e3066fcda","observation_id":"7cfad83f-1844-4e05-bd39-545c05c87055","resolution":{"observed_at":"2026-08-07T14:00:13.887723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.573843Z","title":null,"venue":null,"work_id":"36c2f07a-6844-414f-bc82-b53fe6b35316","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.368910Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:ebf14854ab6c0062b166667d3a59d91be8a40e6a79c4c361a82154721cda0af1","observation_id":"5a69f598-9492-4f2f-9fae-7ff0a3fae857","resolution":{"observed_at":"2026-08-07T14:00:13.690433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.384270Z","title":"30th St, Los Angeles, CA 90007, United States","venue":null,"work_id":"41dd37c7-8f73-4bbc-befb-7e92d5177790","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.477728Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:21ebb695d71881f5377fc812072d9735e52143f9a72dc6ffdd104db7b09dc199","observation_id":"31c08b3f-f936-4835-a655-dd0b0814f96d","resolution":{"observed_at":"2026-08-07T14:00:13.472286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.184122Z","title":"20th St, New York, NY 10011, United States","venue":null,"work_id":"c263d0c3-a0d8-4e5b-a7c8-128b41b35178","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.616468Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:378808a5b2f209a2efad1f695abdb8c97c0c5fd68d8e04a35c9c165c15a91b94","observation_id":"40ae3064-2211-4898-a35e-6815b8005f54","resolution":{"observed_at":"2026-08-07T14:00:13.291874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:13.007828Z","title":null,"venue":null,"work_id":"b4603682-8e1a-4abd-b3f5-ec050975a17e","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.708628Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:64c93d20f2794a5f4900b6313bdc76ed360a3e3218dc33f2c8e0a40fdd83312e","observation_id":"1c729329-57f8-4f55-9021-d2181740f2b0","resolution":{"observed_at":"2026-08-07T14:00:13.095931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:12.853327Z","title":"pythonchemicals =","venue":null,"work_id":"c69da90f-3664-41ce-8f86-9ca9adccbe5e","year":null},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:11.823481Z"},"links":{"citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:0cdd9047017732ce8ccdb27fb552e2ba0864169b4fe75edc8a63223e8ebb0dbe","observation_id":"2384860d-b0e0-4adb-a710-7757d15df4ec","resolution":{"observed_at":"2026-08-07T14:00:12.905731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 3 inbound Pith citation observations for arXiv:2505.20259."}