{"as_of":"2026-08-10T03:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f67a454648421bca59a30a46fb7b25129e937768858266224c189f2dc60240e0","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:14:34.157748Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02153/citation-record","integrity":"/paper/2502.02153/integrity","json":"/paper/2502.02153/citation-record.json","paper":"/paper/2502.02153"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T13:14:33.962283Z","title":"GPT -4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.962283Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:26407e9bcd92ab7789eec41cb45704ebf81f93bdf8a14dc2fe7ad4819f75e669","observation_id":"5e99a51a-78c5-41c9-b065-1cd0e964302c","resolution":{"observed_at":"2026-08-09T13:14:33.962283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-09T13:14:33.966846Z","title":"Concrete problems in AI safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.966846Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:8f94834edf0206a76eb8e95539414c5a41683cd292f623c19e11ee64a5869977","observation_id":"46e8b5c1-bf95-4261-af75-94fec11633a3","resolution":{"observed_at":"2026-08-09T13:14:33.966846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.792916Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"bcaa44b9-99ed-4e6e-be54-d1c5814d6b9d","year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.971023Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:9fec35c44a5cebd2d72d7a157de18ff38f3f02b97f03ff1f210262e35754abd0","observation_id":"e9ec5777-ad42-4e52-a73e-8723cdbbbe3c","resolution":{"observed_at":"2026-08-09T13:14:34.796288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-09T13:14:33.974327Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.974327Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:d56650062cc5b7c92e36ebe2e5ef6ef2e67e1d17261ded31f2dc6efae0e0566b","observation_id":"5c7e0272-d3be-44bc-bfff-8c652f2e3c3f","resolution":{"observed_at":"2026-08-09T13:14:33.974327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.783385Z","title":"The ethics of artificial intelligence","venue":null,"work_id":"87a01397-c233-495b-ba4c-1bcd60280d1f","year":2018},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.977968Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:3f8e6caa01c0b1677d5967ec8332bc8d7fff215c952c74db8dbb97a380cf04fa","observation_id":"184e74a8-9b08-463c-850f-5e5d9544af9b","resolution":{"observed_at":"2026-08-09T13:14:34.786736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01957","last_updated":"2023-10-13T21:59:27Z","snapshot_observed_at":"2026-08-09T10:06:04.588162Z","submitted_at":"2023-10-03T11:05:14Z","title":"Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01957","snapshot_observed_at":"2026-08-09T13:14:33.981567Z","title":"Driving with llms: Fusing object-level vector modality for explainable autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.981567Z"},"links":{"cited_paper":"/paper/2310.01957","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:31c518a3ea0b10ce80b09cb5bbefaf5c41c1d33b1fd31863a083e7ddc6f29cf1","observation_id":"7db00aeb-e6a8-4640-8b25-34ecbf99858e","resolution":{"observed_at":"2026-08-09T13:14:33.981567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-09T13:14:33.985207Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.985207Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:89820bcd58238c61ed65bb603db15964a91bd2cb05c0ed34c01b532f529bd26e","observation_id":"e750a8bd-f1da-499c-9799-0934458e5bd8","resolution":{"observed_at":"2026-08-09T13:14:33.985207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.774294Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"2ef43b3b-7586-481f-b950-0dca5c4eb4b5","year":2017},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.988726Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:ef14375d7df565973cc6847c0418ded779fd31cbbf8771b800251fe14ff66562","observation_id":"11c5e9c0-6400-4e2e-94bb-ab5198eadf68","resolution":{"observed_at":"2026-08-09T13:14:34.777594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16092","last_updated":"2026-06-08T08:40:57Z","snapshot_observed_at":"2026-07-06T15:47:45.886474Z","submitted_at":"2023-06-28T10:48:34Z","title":"Chatlaw: A Multi-Agent Legal Assistant based on a Role-Aligned Mixture-of-Experts Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16092","snapshot_observed_at":"2026-08-09T13:14:33.992120Z","title":"Chatlaw: Open-source legal large language model with integrated external knowledge bases","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.992120Z"},"links":{"cited_paper":"/paper/2306.16092","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:8b7e81287fc6f170948350ba0cb30a8acda05e6f0273cda702c3107491a6fe67","observation_id":"fc7cf301-b09c-47d7-b707-001fba0ffc63","resolution":{"observed_at":"2026-08-09T13:14:33.992120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.764070Z","title":"Safe RLHF : Safe reinforcement learning from human feedback","venue":null,"work_id":"50f96bb0-2d65-4191-8c2f-d7a6837e64d8","year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:33.997032Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:4ef1880b59058a8bb7cae9c79c6614ed7924614883ef9cecf8272fd271de0b4a","observation_id":"dfab5b30-930c-4324-b9f7-71afa4d2da0a","resolution":{"observed_at":"2026-08-09T13:14:34.767615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09520","last_updated":"2024-01-02T00:04:13Z","snapshot_observed_at":"2026-08-04T13:00:41.768487Z","submitted_at":"2023-10-14T07:19:47Z","title":"Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model","version":4},"cited_work":{"arxiv_id":"2310.09520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09520","snapshot_observed_at":"2026-08-09T13:14:34.567324Z","title":"Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model","venue":"cs.CL","work_id":"8e8c6d43-f818-47de-b7f5-fc7745b12d52","year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.000270Z"},"links":{"cited_paper":"/paper/2310.09520","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:38cd5979d35c7c1c271aecd7a0ee49007fda0cdb397148d7099cb42b1d482713","observation_id":"cb5db034-2f19-4d33-9cc9-24dbfe1d4142","resolution":{"observed_at":"2026-08-09T13:14:34.570965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T13:14:34.003785Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.003785Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:537aa1113568718fd535170f35fa9df42e074ab19c56c06b62bbd5d0ff342b4d","observation_id":"b13d94c2-4825-4279-b487-e61718bb53ce","resolution":{"observed_at":"2026-08-09T13:14:34.003785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-09T13:14:34.007032Z","title":"KTO : Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.007032Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:277866674df46f1ca4db855eb87f6789b4e577f70181483d0d29bfc166e9f224","observation_id":"6e1a8042-a0c2-4117-852c-1aca7cb31e64","resolution":{"observed_at":"2026-08-09T13:14:34.007032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.754962Z","title":"Pal: Program-aided language models","venue":null,"work_id":"2e9e1d7c-94d4-4007-a26d-54fec77816d6","year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.010357Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:e7cce61cb7f1ec3a267c64f81238a53ea04ed5b6e5401fa56522626f1085eee1","observation_id":"9f96e0cd-a1b2-423d-9820-ca7046ffb9a6","resolution":{"observed_at":"2026-08-09T13:14:34.758369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-09T13:14:34.013524Z","title":"Realtoxicityprompts: Evaluating neural toxic degeneration in language models","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.013524Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:4521a66203d84b95c97cccb86bd606a1ede375c20a18305df125ce7f67203847","observation_id":"9101effa-532c-40d7-b501-1987bd7cde2e","resolution":{"observed_at":"2026-08-09T13:14:34.013524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.016884Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.016884Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:d8c1c1f2e2960b061625ac31d7dae4dfa06ed1cef5d8c4659f049e0c022cce37","observation_id":"af0096dc-7c00-40b2-abc7-e90bd0b509c7","resolution":{"observed_at":"2026-08-09T13:14:34.016884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-09T13:14:34.020591Z","title":"Reference-free monolithic preference optimization with odds ratio","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.020591Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:16ea7eb58f79846bddc56f1396e6888920e4e02ed7bb5763b82adb0b8c55c759","observation_id":"902cc25e-67ee-4d32-b70d-0278c7fc7eeb","resolution":{"observed_at":"2026-08-09T13:14:34.020591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19544","last_updated":"2024-11-22T05:55:58Z","snapshot_observed_at":"2026-07-06T18:22:18.644161Z","submitted_at":"2024-05-29T22:12:52Z","title":"One-Shot Safety Alignment for Large Language Models via Optimal Dualization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19544","snapshot_observed_at":"2026-08-09T13:14:34.024260Z","title":"One-shot safety alignment for large language models via optimal dualization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.024260Z"},"links":{"cited_paper":"/paper/2405.19544","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:1fca962448e59bd607f7e01cd1740f2952547b736fb31149120f7756e18b58e1","observation_id":"fdb16407-657e-4b5d-b21f-9dcc3433fc89","resolution":{"observed_at":"2026-08-09T13:14:34.024260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-09T13:14:34.027501Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.027501Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:9edbb13b52794838a6f997b36448b50df3c016f7d3e25f1ce69c29f40f382dfa","observation_id":"98c68720-f744-4ff2-869d-311c1b393377","resolution":{"observed_at":"2026-08-09T13:14:34.027501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.739985Z","title":"Reference point specification in hypervolume calculation for fair comparison and efficient search","venue":null,"work_id":"43a07237-3314-4ae0-90b8-f4382d22c03b","year":2017},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.031002Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:71c8434ea2e21125f50035adb7d7eb853e1a86677b0fe88b1d9572a9c8a34d84","observation_id":"3c1d3a8a-76af-43e3-993a-6aaa39a579f6","resolution":{"observed_at":"2026-08-09T13:14:34.743349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-09T13:14:34.034236Z","title":"AI alignment: A comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.034236Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:e2830ebfe01f56f02b2ef0571a4fa31a3a0a594c9e3166820d4972942d29fdc1","observation_id":"33c186d5-3f4b-4479-ad01-e69a2adf1ffd","resolution":{"observed_at":"2026-08-09T13:14:34.034236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-09T13:14:34.037586Z","title":"Pku-saferlhf: A safety alignment preference dataset for llama family models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.037586Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:fc7fd31476a4d32fc62cef013736a0e7aa6f294ef14b2dc6a2fef028f935ace3","observation_id":"44ab9950-d943-44e9-9e48-8df82a5721f4","resolution":{"observed_at":"2026-08-09T13:14:34.037586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.731049Z","title":"Beavertails: Towards improved safety alignment of LLM via a human-preference dataset","venue":null,"work_id":"f8a9d992-a972-446a-986c-bbb69e3024e5","year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.040891Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:c2f006baac2870d403c0d6e1f28aa762d96c1757d13d93528027bf410f2bb8ab","observation_id":"4afe23c0-593d-431b-9087-6b094fb3db7d","resolution":{"observed_at":"2026-08-09T13:14:34.734394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-03T21:40:53.683032Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-09T13:14:34.043782Z","title":"SALAD-Bench : A hierarchical and comprehensive safety benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.043782Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:4e6c2b24aaf021daf6c4b83215f6ee8a6db80ea0fb387f9534649b20faf55e11","observation_id":"3de26fcb-5bcd-45b2-afd1-e7c91484d7ce","resolution":{"observed_at":"2026-08-09T13:14:34.043782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06824","last_updated":"2025-02-21T05:17:52Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-12T00:50:04Z","title":"Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06824","snapshot_observed_at":"2026-08-09T13:14:34.046987Z","title":"Rethinking jailbreaking through the lens of representation engineering, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.046987Z"},"links":{"cited_paper":"/paper/2401.06824","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:079fd6d3f3039fb0bdc26e914a1cf7e1cc0eb675ae20a1026e2cab5c96ee7455","observation_id":"b2953044-edaf-4691-82c5-bebcce94a697","resolution":{"observed_at":"2026-08-09T13:14:34.046987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12599","last_updated":"2024-08-22T17:59:04Z","snapshot_observed_at":"2026-08-09T21:12:10.507853Z","submitted_at":"2024-08-22T17:59:04Z","title":"Controllable Text Generation for Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12599","snapshot_observed_at":"2026-08-09T13:14:34.050480Z","title":"Controllable text generation for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.050480Z"},"links":{"cited_paper":"/paper/2408.12599","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:8a4db129e073f346f2dbea55fd9772c0aed2107e8e1c9b4e613b3e2dbb9ba87a","observation_id":"dc250669-7669-49bd-8277-958dea84a5d3","resolution":{"observed_at":"2026-08-09T13:14:34.050480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-09T13:14:34.053735Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.053735Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:8c1a7d4fcdd4b6a540cc5d038f24a606ce4bb9f97d98ca942ab221cf4d75ff60","observation_id":"3c54c4e0-4462-4e33-8941-af2e662b11c2","resolution":{"observed_at":"2026-08-09T13:14:34.053735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-09T13:14:34.056797Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.056797Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:5df88f486cbae731ad31d50b36370630c0fc2d34b449f70dc7e580fa1fb3947e","observation_id":"7c9328f6-2725-4373-b282-8c910e68d096","resolution":{"observed_at":"2026-08-09T13:14:34.056797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-09T13:14:34.060395Z","title":"Trustworthy LLMs : a survey and guideline for evaluating large language models' alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.060395Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:320736b2c896f8178b0aca0ee9b894a31aacfafd55c641a2ee559346e184ecc5","observation_id":"319a4ab5-96ea-43be-a1f6-df6a5040b93f","resolution":{"observed_at":"2026-08-09T13:14:34.060395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-08-08T15:03:18.474377Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-09T13:14:34.063868Z","title":"Enhancing LLM safety via constrained direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.063868Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:039cfdf687f89e5db56bca58080e40b7c5c235795a60910dc0e9a59987fc8bf4","observation_id":"8a1a9168-3123-4793-9419-953e9e725e33","resolution":{"observed_at":"2026-08-09T13:14:34.063868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.722139Z","title":"Meta llama guard 2","venue":null,"work_id":"4000330c-231b-45d2-9a46-ce7ae27bc7a2","year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.067238Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:e3e1af36ff13b85c337e13a25750bff167f7f140db7727ff3acf71d4ef7a19f4","observation_id":"07339d1c-e2e0-412f-af1f-cc06439acf89","resolution":{"observed_at":"2026-08-09T13:14:34.725163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T13:14:34.070762Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.070762Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:6cb1786a9b6a997e0d805f975212ea98a40aaf03629b691120c00583109be0ae","observation_id":"5ff434a2-881c-4014-822f-0c9e403eee70","resolution":{"observed_at":"2026-08-09T13:14:34.070762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.712967Z","title":"Controlled decoding from language models","venue":null,"work_id":"f9d3c4e7-fec8-4bfd-affb-a21f9596f0bc","year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.073861Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:641ec96ccf74777779f7bede12082498b02d67cf5090d015f371d29fdd33c378","observation_id":"cabeddd7-716a-4913-be82-5143ffd63a3c","resolution":{"observed_at":"2026-08-09T13:14:34.716141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.703797Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"68ec3e22-78b3-4b09-827f-70683a159070","year":2022},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.077142Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:3933a8632d05a189c89faf3713f1e1fb85c90281f956f8a963ac8d42b40e72a7","observation_id":"45c92630-c3b6-4cf6-9000-1558fc446376","resolution":{"observed_at":"2026-08-09T13:14:34.707231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-09T13:14:34.081017Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.081017Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:449b95971289cfe09b815c5c06e76954fe91a75fcd20853f12da33f663c83599","observation_id":"c2952507-47d7-4919-8b83-911c110e49ec","resolution":{"observed_at":"2026-08-09T13:14:34.081017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-08T03:05:18.803803Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-09T13:14:34.084092Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.084092Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:cf883512684683e61a87fc7d1c40675288139e6783d1b0c8a95ebaa06f060d8c","observation_id":"3bfc7c9d-2f7f-41eb-b1cd-3363dd6a452d","resolution":{"observed_at":"2026-08-09T13:14:34.084092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.087213Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.087213Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:ba83d1f896cdb922674e1a7b91268bd1cd064bae28e3e2b6b7cd471b782b57cc","observation_id":"f0ddc9fd-24d8-469a-b31b-710ddb4b2787","resolution":{"observed_at":"2026-08-09T13:14:34.087213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-09T13:14:34.091162Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.091162Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:d6b41a33ff01d16d663a9f97a76a5ce5d858d2ac265be8e4cc7f427090dc0e14","observation_id":"ceac96ca-22cb-4c6f-af82-1ec1d217ac9c","resolution":{"observed_at":"2026-08-09T13:14:34.091162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T13:14:34.094349Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.094349Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:7db5ce1b18f708fce8f46d01a6f3e33107da7dec898383b485d476a7ccb0f221","observation_id":"d36f4813-4d84-4cbe-9bed-3d4848a17769","resolution":{"observed_at":"2026-08-09T13:14:34.094349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.688080Z","title":"LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action","venue":null,"work_id":"6469182b-0e91-4bd8-bc73-33e4b3f3ebc5","year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.097713Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:2a7b213838b802e7613a08429f51505f3e93c55cace0379e92350237b66a4fb8","observation_id":"d2fcfa10-a98d-45f9-9406-c10bcee36b09","resolution":{"observed_at":"2026-08-09T13:14:34.691469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.100760Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.100760Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:e3f907cf4e7f459a9d186a7389e60452663240e9f8bd140bbfd2e6db5eb6aab9","observation_id":"1166d32d-20bd-4c3b-b1e8-4d4ce1f46fc9","resolution":{"observed_at":"2026-08-09T13:14:34.100760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.104154Z","title":"Large language models in medicine","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.104154Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:9ae1213d978450df795372cb88e5cd918b840ada588336cf37263b25811ad668","observation_id":"01242aff-dd32-464f-872b-43b3309c24e5","resolution":{"observed_at":"2026-08-09T13:14:34.104154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.668082Z","title":"TRL : Transformer reinforcement learning","venue":null,"work_id":"cc65e2fb-7240-4b0e-bb86-0107df67c1d2","year":2020},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.107392Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:cf286185e0f0531453e6ecaa981b84552c4b607135a8744248406e37701ea042","observation_id":"df906c89-96cd-4fb8-a106-c46f4b520c8f","resolution":{"observed_at":"2026-08-09T13:14:34.671249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11049","last_updated":"2024-10-21T00:42:51Z","snapshot_observed_at":"2026-07-06T18:01:18.745347Z","submitted_at":"2024-04-17T03:44:58Z","title":"Stepwise Alignment for Constrained Language Model Policy Optimization","version":3},"cited_work":{"arxiv_id":"2404.11049","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.11049","snapshot_observed_at":"2026-08-09T13:14:34.270853Z","title":"Stepwise Alignment for Constrained Language Model Policy Optimization","venue":"cs.LG","work_id":"7c5be90c-2f96-4a65-96eb-f92a0b47c32c","year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.110335Z"},"links":{"cited_paper":"/paper/2404.11049","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:540029b639cab887965b72984e03d3997c27581cf87d548bd865f64d31e9b0d9","observation_id":"306839f3-de22-4a95-8c25-eb9eaf73ecb4","resolution":{"observed_at":"2026-08-09T13:14:34.276505Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11698","last_updated":"2024-02-26T20:41:01Z","snapshot_observed_at":"2026-08-07T02:34:39.980213Z","submitted_at":"2023-06-20T17:24:23Z","title":"DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11698","snapshot_observed_at":"2026-08-09T13:14:34.113399Z","title":"Decodingtrust: A comprehensive assessment of trustworthiness in GPT models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.113399Z"},"links":{"cited_paper":"/paper/2306.11698","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:96f78fb8990bb564f1ffa83dbacb9f0d1551cdfcaf07d5b3adbbb1500b848bcb","observation_id":"b219fbce-6ee7-4844-887d-2171c5551971","resolution":{"observed_at":"2026-08-09T13:14:34.113399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-09T13:14:34.116590Z","title":"Do-not-answer: A dataset for evaluating safeguards in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.116590Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:ab691083d954c5d11f8135e153bbc79580a39f7a1bdc091505f1c7d3d678d740","observation_id":"aebf8f1a-3c1c-4fe8-a5c7-c90c725ec6d2","resolution":{"observed_at":"2026-08-09T13:14:34.116590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.120042Z","title":"Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.120042Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:581a354efd64d76c2284ec2bd1b3073cc56af014964d67fd7be49cc756e007df","observation_id":"7bddb868-48fb-4ea8-b6c4-115df35357a5","resolution":{"observed_at":"2026-08-09T13:14:34.120042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.653142Z","title":"Defending chatgpt against jailbreak attack via self-reminders","venue":null,"work_id":"7bf7a36f-78f3-4ae3-8891-70ae997cabc2","year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.123076Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:f070ac6ad08a0fc56a07c7755992cccc38df11a2a654882566d09ff96ace1ead","observation_id":"8161e2b2-6649-4b2c-8fa1-387350c8f91d","resolution":{"observed_at":"2026-08-09T13:14:34.656375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-09T13:14:34.126221Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.126221Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:ebdc98f0f7be1454045337e63bbf027310eadca6dc1c35d8a02ba98b55f141be","observation_id":"2ad5719c-32d5-46eb-b9c6-9bcddfe21f03","resolution":{"observed_at":"2026-08-09T13:14:34.126221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12038","last_updated":"2024-11-30T08:52:29Z","snapshot_observed_at":"2026-07-06T18:02:06.709537Z","submitted_at":"2024-04-18T09:46:25Z","title":"Uncovering Safety Risks of Large Language Models through Concept Activation Vector","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12038","snapshot_observed_at":"2026-08-09T13:14:34.129562Z","title":"Uncovering safety risks of large language models through concept activation vector, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.129562Z"},"links":{"cited_paper":"/paper/2404.12038","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:143146b25658c68fd7f94afa58afe21e0ecea2a6e2978bb09cc5f36ca2829f3a","observation_id":"36981ff1-9520-433a-ad4b-23e1a8cb120f","resolution":{"observed_at":"2026-08-09T13:14:34.129562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-07T11:20:01.991656Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-09T13:14:34.132795Z","title":"Shadow alignment: The ease of subverting safely-aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.132795Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:55b4aba4baea0bd992802bda1eb97c08edf07c9af606f143251952da07272720","observation_id":"81b9a09f-61db-463b-8b6d-d0322382fd37","resolution":{"observed_at":"2026-08-09T13:14:34.132795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.643595Z","title":"On the vulnerability of safety alignment in open-access llms","venue":null,"work_id":"cc6563fd-da08-4245-9be6-b81219bb4ca7","year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.136025Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:5f74a965f24ae4dc9ecba551def773cb14026135aaeb41480d1de44d27a1a0db","observation_id":"964664c9-7fef-45f7-92a2-028c2ff6a4a3","resolution":{"observed_at":"2026-08-09T13:14:34.647067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.633774Z","title":"Wordcraft: story writing with large language models","venue":null,"work_id":"dce06432-1199-4973-a716-6a47b6cdf9f6","year":2022},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.139018Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:8b1555663a249f8f2c2f9c2bbaef9e6975d0323ddb04abbcf50c2489eaa6e23c","observation_id":"7c1fbb45-dc78-4bd2-b6b9-a3ed47dc4c18","resolution":{"observed_at":"2026-08-09T13:14:34.637485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:14:34.624126Z","title":"Prompting large language model for machine translation: A case study","venue":null,"work_id":"55a8632b-9f67-43fc-ab4b-f50893835637","year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.141806Z"},"links":{"citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:da1989592d06670d7de8bcca11754ed7584fe86906180fb40f1dec8270029ff2","observation_id":"d7069d77-86be-4656-864c-0050591e34ce","resolution":{"observed_at":"2026-08-09T13:14:34.627614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02030","last_updated":"2024-05-23T13:49:25Z","snapshot_observed_at":"2026-08-09T23:57:07.392227Z","submitted_at":"2024-02-03T05:01:04Z","title":"Panacea: Pareto Alignment via Preference Adaptation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02030","snapshot_observed_at":"2026-08-09T13:14:34.144946Z","title":"Panacea: Pareto alignment via preference adaptation for LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.144946Z"},"links":{"cited_paper":"/paper/2402.02030","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:30b6297b6ab9b781d55e826eb4a659c1c966f9945bd642babf5ad46db56ea76b","observation_id":"5f3243ae-972c-4be3-991e-2052a8ea7f29","resolution":{"observed_at":"2026-08-09T13:14:34.144946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03708","last_updated":"2024-08-17T13:39:13Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:35:26Z","title":"Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03708","snapshot_observed_at":"2026-08-09T13:14:34.148019Z","title":"Beyond one-preference-for-all: Multi-objective direct preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.148019Z"},"links":{"cited_paper":"/paper/2310.03708","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:9a6cc012c606800d38aa438e479227a85678fff1fd0e36b19e22981545c8200d","observation_id":"a96d3a07-5cec-41bb-a301-0f48fbcc06ff","resolution":{"observed_at":"2026-08-09T13:14:34.148019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-09T13:14:34.151110Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.151110Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:f050085081eaeff21777a125ad6a0737b4f2bb7d646a0d5e5eb17387e2febe55","observation_id":"d7d0fdc2-7580-4405-948e-bdcdcc2e787e","resolution":{"observed_at":"2026-08-09T13:14:34.151110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-09T13:14:34.154654Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.154654Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:6d840ea7c38af8ad6151b6b550982555e5e0be0dc3ccbfe91a89aa302d83f4a7","observation_id":"24ee1b5c-135b-4add-a6e1-7b061bef9de6","resolution":{"observed_at":"2026-08-09T13:14:34.154654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04313","last_updated":"2024-07-12T16:51:07Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:57:04Z","title":"Improving Alignment and Robustness with Circuit Breakers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04313","snapshot_observed_at":"2026-08-09T13:14:34.157748Z","title":"Improving alignment and robustness with short circuiting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.157748Z"},"links":{"cited_paper":"/paper/2406.04313","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:4f582a728c9f991a0bff92a7507e538f3cab0ffc5a51dc4fb45278ad83de0141","observation_id":"fdba3956-662d-498f-b783-e492e8e943b5","resolution":{"observed_at":"2026-08-09T13:14:34.157748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T00:34:18.762743Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2502.02153."}