{"as_of":"2026-08-08T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bd8bedd12a2af0c8684ab7d8e30f2f0bb71af3d2b81efe8ec78f3baf5aba6cd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:58:32.538591Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T05:39:40.653733Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T21:28:02.745230Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2402.10260"},"observation_digest":"sha256:79b18ace20c34d0ef1e75616d794e2ae94de59b5b4f8c7841393b6a4ddb43fad","observation_id":"d3a1fce6-3ae4-4331-beba-8a22e0d1e594","resolution":{"observed_at":"2026-05-16T21:28:02.892798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-02T04:29:28.130280Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T04:18:27.597704Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2404.08144"},"observation_digest":"sha256:d65b9b0248cc802a2237af2159d55d8a4cb037395f0384d82fc5791686fb747f","observation_id":"d438dfad-e3f6-46b6-b417-7baa05af7aa5","resolution":{"observed_at":"2026-05-18T04:18:27.668214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":205,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:a1bfa552ea44ef15d0584c112bef3abd5472b8d57454b0fa43a03609ca70ad73","observation_id":"08b13389-b693-485c-9a26-527420eaa3d1","resolution":{"observed_at":"2026-05-13T10:47:56.171172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:df6558ad17b0860d327436ad7dde8d7cc978e5dd702c9a40fc6567c0d9bc5a9c","observation_id":"d76278a6-65bb-4712-b4da-f9c535c79cde","resolution":{"observed_at":"2026-05-15T02:20:44.473852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:8ec5c6645a87522f1ac61860ca1eefd57fc03ecd7d392c87097e70b61f5cb511","observation_id":"da4add40-2fa4-4b49-8281-4abcaf742df1","resolution":{"observed_at":"2026-05-23T20:58:26.504406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-07T10:58:32.538591Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03850","last_updated":"2025-08-12T10:16:47Z","snapshot_observed_at":"2026-08-07T10:51:48.293184Z","submitted_at":"2025-06-04T11:33:36Z","title":"Vulnerability-Aware Alignment: Mitigating Uneven Forgetting in Harmful Fine-Tuning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:58:32.538591Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2506.03850"},"observation_digest":"sha256:ef1a9c68df54ebd62df7da91e32678b91d7dee03f6f44c86c53da8b9e0dd8ce6","observation_id":"382b390f-a3a8-4031-8574-31eb66cb9f27","resolution":{"observed_at":"2026-08-07T10:58:32.538591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-06T23:20:57.988075Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.988075Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d9513858eba2a819578680ece93c49a01a36c8f5ea85331da765d8b0bd097c5b","observation_id":"ab1d7d35-a32d-4fb2-9219-90097f0a8d86","resolution":{"observed_at":"2026-08-06T23:20:57.988075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-05T20:31:36.407857Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-08T02:31:17.622343Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:36.407857Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:6df05d4ab9f7cd46bfd0d3f7f19049002a205ae383ea3e473f7664eeee1c6d03","observation_id":"e2fffb31-5954-4016-ac38-f43310662a1b","resolution":{"observed_at":"2026-08-05T20:31:36.407857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-05T18:12:37.016328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15068","last_updated":"2025-08-20T21:08:29Z","snapshot_observed_at":"2026-08-07T05:02:51.529077Z","submitted_at":"2025-08-20T21:08:29Z","title":"S3LoRA: Safe Spectral Sharpness-Guided Pruning in Adaptation of Agent Planner","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T18:12:37.016328Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2508.15068"},"observation_digest":"sha256:589deb82d492ca3bfe4e9f87735627b04ab0043c8c5dc827e5da17b8ce8cafb4","observation_id":"d59c73aa-0579-466e-b148-13041ea73cf9","resolution":{"observed_at":"2026-08-05T18:12:37.016328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-05T14:57:12.962460Z","title":"Removing RLHF protections in GPT-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.962460Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:6de448921917b834c54001087a51b04e44f4b4660f5bb936f4411b6a9f01662d","observation_id":"cee53ca1-667e-4e37-bb0f-bb69aa9df89f","resolution":{"observed_at":"2026-08-05T14:57:12.962460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T23:10:21.306994Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-06T11:18:33.345942Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.306994Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:9767cc92ea9edd8da5816a4d59fd93dd5c5c2c3ed11893c33b17e83f8191efaf","observation_id":"5d1f1798-edec-42e1-96a8-a70f3a11a1e9","resolution":{"observed_at":"2026-08-04T23:10:21.306994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T23:09:41.530996Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.530996Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:30b711e6c794b3bb8359b42c8d5e1981e50d93bf0493b7c3f23d9ebd58edffda","observation_id":"60840032-8432-4455-8d31-8136cb96982e","resolution":{"observed_at":"2026-08-04T23:09:41.530996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T22:33:28.837716Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07287","last_updated":"2025-09-08T23:44:00Z","snapshot_observed_at":"2026-08-06T22:54:10.353309Z","submitted_at":"2025-09-08T23:44:00Z","title":"Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T22:33:28.837716Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.07287"},"observation_digest":"sha256:9c93ba2a34e66ca64a486af89fca06bfa467a9ab93393a5df44d1a8ba82eedf9","observation_id":"d4d2b640-0807-482c-98e5-f9235fcac7af","resolution":{"observed_at":"2026-08-04T22:33:28.837716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:8c85bef5335cf2b84abcfe6d38b84aaff92b518008a3b371024765ded203d5b9","observation_id":"4f08c312-b145-4507-a47f-db9af96708e9","resolution":{"observed_at":"2026-05-16T05:37:24.223558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2604.14990","last_updated":"2026-07-28T14:52:22Z","snapshot_observed_at":"2026-08-02T16:13:11.296620Z","submitted_at":"2026-04-16T13:19:45Z","title":"The Possibility of Artificial Intelligence Becoming a Subject and the Alignment Problem","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T10:41:14.970156Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2604.14990"},"observation_digest":"sha256:eef1d23a1113089dbe33406ce991c7216d439559e40afccea0c0f3692ec77911","observation_id":"c9d07f83-bfc7-44a4-aacb-e4d1a4a6dac3","resolution":{"observed_at":"2026-05-10T10:44:37.742433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T16:13:13.877328Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.14990","last_updated":"2026-07-28T14:52:22Z","snapshot_observed_at":"2026-08-02T16:13:11.296620Z","submitted_at":"2026-04-16T13:19:45Z","title":"The Possibility of Artificial Intelligence Becoming a Subject and the Alignment Problem","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T16:13:13.877328Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2604.14990"},"observation_digest":"sha256:d0241d27b608a7b59d7c32ed2492c681750b369719e6330fdc03da09d0399f8f","observation_id":"192a1bc1-ec29-49b7-bb81-ab010516d622","resolution":{"observed_at":"2026-08-02T16:13:13.877328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2604.17396","last_updated":"2026-04-19T11:59:58Z","snapshot_observed_at":"2026-08-01T18:23:32.699442Z","submitted_at":"2026-04-19T11:59:58Z","title":"Representation-Guided Parameter-Efficient LLM Unlearning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T06:01:46.885030Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2604.17396"},"observation_digest":"sha256:9101f50cadd000f1dcd4703c3e5248250f1be1dd19ab7f33a4b548c238f9cc3a","observation_id":"b7e7202d-0fa1-44cd-a743-f8d94550050b","resolution":{"observed_at":"2026-05-10T06:06:19.404876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2605.04992","last_updated":"2026-05-06T14:52:22Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T14:52:22Z","title":"You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation","version":1},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-05-08T17:02:20.836208Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2605.04992"},"observation_digest":"sha256:ed92455534728355b500c4465e0838b7c777552a531fa8b1a3631959daae9bf8","observation_id":"023e10d7-9b08-4f5e-b37d-f7027db4232a","resolution":{"observed_at":"2026-05-11T17:51:08.458732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2606.19890","last_updated":"2026-06-18T07:48:24Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T07:48:24Z","title":"Open Weight AI Models Require Proportional Evaluation Approaches","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T15:39:45.969260Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2606.19890"},"observation_digest":"sha256:60df712d793e372366c3946af8f7ea7affde3bb1e26252adf0e869a23a2611dd","observation_id":"1cf88bd4-e26a-4ec8-ae27-9674b19c91ac","resolution":{"observed_at":"2026-07-04T05:39:40.655924Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T07:44:12.338931Z","title":"Junhao Zheng, Shengjie Qiu, Chengming Shi, and Qianli Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-06T09:33:49.866018Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.338931Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:513febe6c578965536e5572c4a41850ba217aa08caa6bdbd2fb95e751e3d4a29","observation_id":"0bc464dc-398e-45a6-a3c0-388d06036cc7","resolution":{"observed_at":"2026-08-02T07:44:12.338931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T10:22:17.273139Z","title":"42 Goodhart, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26069","last_updated":"2026-06-23T08:57:30Z","snapshot_observed_at":"2026-08-07T03:56:02.478412Z","submitted_at":"2026-06-23T08:57:30Z","title":"AI Security Priorities: A Field-Wide Agenda","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T10:22:17.273139Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2607.26069"},"observation_digest":"sha256:8e705668b4e61c8a342996f594e8caaf8ca718481525f08ff406a0ed204aa14a","observation_id":"2c0ce0e2-6c99-4603-94ce-9450a6693d79","resolution":{"observed_at":"2026-08-02T10:22:17.273139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.05553/citation-record","integrity":"/paper/2311.05553/integrity","json":"/paper/2311.05553/citation-record.json","paper":"/paper/2311.05553"},"outbound":[],"paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2311.05553."}