{"as_of":"2026-08-07T18:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d33b5b14ee800a2537919161f715a817220dcaf7a608ba7069f4e4f5754e626d","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:59:58.413814Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:01:25.549340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T21:05:04.061254Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"cited_work":{"arxiv_id":"2506.15606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15606","snapshot_observed_at":"2026-06-30T21:05:04.061254Z","title":"J., Chen, R., Chen, X., Hirata, N","venue":null,"work_id":"70935086-44ba-4f6d-bc3e-060caaffb7b7","year":2025},"citing_paper":{"arxiv_id":"2602.07340","last_updated":"2026-05-21T07:39:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T03:46:33Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T11:17:03.104902Z"},"links":{"cited_paper":"/paper/2506.15606","citing_paper":"/paper/2602.07340"},"observation_digest":"sha256:1cfa30ac624208e1b50cab19351e7502559074f28694dbb66743b2ab76867e9b","observation_id":"3b7f2f16-529f-46d7-b07b-d0fddd69fd39","resolution":{"observed_at":"2026-05-22T11:21:29.060044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"cited_work":{"arxiv_id":"2506.15606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15606","snapshot_observed_at":"2026-06-30T21:05:04.061254Z","title":"J., Chen, R., Chen, X., Hirata, N","venue":null,"work_id":"70935086-44ba-4f6d-bc3e-060caaffb7b7","year":2025},"citing_paper":{"arxiv_id":"2604.12384","last_updated":"2026-04-14T07:17:55Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:17:55Z","title":"Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T16:04:25.851592Z"},"links":{"cited_paper":"/paper/2506.15606","citing_paper":"/paper/2604.12384"},"observation_digest":"sha256:0c06ea79c8f5c348532c4ba303175f97a18fe2c957232352f9cb0186a121bd73","observation_id":"12261f88-9c3a-4ae5-ac59-179bf9f182b1","resolution":{"observed_at":"2026-05-11T09:21:01.852959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"cited_work":{"arxiv_id":"2506.15606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15606","snapshot_observed_at":"2026-06-30T21:05:04.061254Z","title":"J., Chen, R., Chen, X., Hirata, N","venue":null,"work_id":"70935086-44ba-4f6d-bc3e-060caaffb7b7","year":2025},"citing_paper":{"arxiv_id":"2605.14605","last_updated":"2026-05-24T08:34:13Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T09:22:14Z","title":"One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T21:01:25.549340Z"},"links":{"cited_paper":"/paper/2506.15606","citing_paper":"/paper/2605.14605"},"observation_digest":"sha256:8485d1bfbfa0afdfe297a61ebf4e5b505823798cdbd265733f1a01e5321fb259","observation_id":"27fd0429-61e2-4e22-b079-1ae9298dbdf0","resolution":{"observed_at":"2026-06-30T21:05:04.062857Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15606/citation-record","integrity":"/paper/2506.15606/integrity","json":"/paper/2506.15606/citation-record.json","paper":"/paper/2506.15606"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-06T23:59:55.404563Z","title":"Refusal in language models is mediated by a single direction.arXiv preprint arXiv:2406.11717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.404563Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:205068030b07a8929d88833e979a83d58d400be3fc61dd51d48e1af3cca4e3b4","observation_id":"8a8038f6-cae6-4811-9b96-a2e436ef41a7","resolution":{"observed_at":"2026-08-06T23:59:55.404563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.506840Z","title":"To visualize these points, we project them onto the 17 Published as a conference paper at COLM 2025 same plane and compute their coordinates in the basis {d1, d2}","venue":null,"work_id":"9b7eabd4-5106-4c55-9b1c-c7fe56dfa337","year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.196559Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:a378411fd738d4abab07330a481d9fe53db7504eb76ddf31f853bc79b07a054d","observation_id":"38b10835-9233-4617-8f6e-0ca7378d3551","resolution":{"observed_at":"2026-08-07T00:00:00.628892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4310.2950","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:59:58.721692Z","title":null,"venue":null,"work_id":"1c05aa22-eebd-4f07-a83b-ac5c821269d4","year":2000},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.924221Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:f5206014f4ff8cde5001ed9b0266f62eb856efdd4c2570bd3911151e2c346216","observation_id":"6154c59f-4f80-4602-8d70-56869e9cd7fc","resolution":{"observed_at":"2026-08-06T23:59:58.836084Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T23:59:55.625447Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.625447Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:dc25f57c96891f497a6b47baad1d2dd300f063c1ba6465dbaafe4382f2930c59","observation_id":"e09b2e7e-2df4-4134-a3ed-e86398956dbb","resolution":{"observed_at":"2026-08-06T23:59:55.625447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-06T23:59:55.772459Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.arXiv preprint arXiv:2209.07858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.772459Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:a6acf59d1f77492fc14c64506226f2225caba7023899a64e329229dba6ebd59b","observation_id":"16c81583-c740-4af3-b0e9-800a2178b7d8","resolution":{"observed_at":"2026-08-06T23:59:55.772459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01099","last_updated":"2024-08-20T17:54:08Z","snapshot_observed_at":"2026-08-04T15:19:09.874751Z","submitted_at":"2024-04-01T13:12:30Z","title":"What is in Your Safe Data? Identifying Benign Data that Breaks Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01099","snapshot_observed_at":"2026-08-06T23:59:55.836898Z","title":"What is in your safe data? identifying benign data that breaks safety.arXiv preprint arXiv:2404.01099,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.836898Z"},"links":{"cited_paper":"/paper/2404.01099","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:4e03f6567044ed0a980bad0b4873cb7e9e010a9351d5533ed1f144031350d662","observation_id":"ca45d46b-9ab3-4090-b410-2d21b055204e","resolution":{"observed_at":"2026-08-06T23:59:55.836898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T23:59:55.892653Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.892653Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:a64fdf3cd8fb28d64298b67372aff51ecfc2d5cc748b94529c4b6fc48a959bd4","observation_id":"13db9a5e-f1e0-43f1-a588-f2004dfe3b97","resolution":{"observed_at":"2026-08-06T23:59:55.892653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09254","last_updated":"2022-12-19T05:55:58Z","snapshot_observed_at":"2026-08-01T21:16:15.264811Z","submitted_at":"2022-12-19T05:55:58Z","title":"TextGrad: Advancing Robustness Evaluation in NLP by Gradient-Driven Optimization","version":1},"cited_work":{"arxiv_id":"2212.09254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09254","snapshot_observed_at":"2026-08-06T23:59:59.609941Z","title":"TextGrad: Advancing Robustness Evaluation in NLP by Gradient-Driven Optimization","venue":"cs.CL","work_id":"a011c053-7e03-4d24-9740-298f72140f3a","year":2022},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.939806Z"},"links":{"cited_paper":"/paper/2212.09254","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:8cd77e13a96ddae53b21866a58d708fb5e80611be6e8da1c2639507f87fde8da","observation_id":"6b4f4abb-ffdd-4245-ae18-b6c2f80a41da","resolution":{"observed_at":"2026-08-06T23:59:59.643808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-06T23:59:56.005326Z","title":"Open- rlhf: An easy-to-use, scalable and high-performance rlhf framework.arXiv preprint arXiv:2405.11143,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.005326Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:ab6b180f27e4a06582ef1881408acf4126f926df294ef645c4ad91148485d176","observation_id":"90737819-ec19-41b8-9199-5be5c2047610","resolution":{"observed_at":"2026-08-06T23:59:56.005326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09600","last_updated":"2025-09-05T04:54:29Z","snapshot_observed_at":"2026-07-06T19:02:11.267510Z","submitted_at":"2024-08-18T21:45:03Z","title":"Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09600","snapshot_observed_at":"2026-08-06T23:59:56.106685Z","title":"Antidote: Post-fine-tuning safety alignment for large language models against harmful fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.106685Z"},"links":{"cited_paper":"/paper/2408.09600","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:9d14f3acf8380c47cfc4c8a85bdba4d7a89376df318097e548e806af28e78534","observation_id":"fa4eff3d-7ade-413d-a974-1b00d9d22bc5","resolution":{"observed_at":"2026-08-06T23:59:56.106685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T23:59:56.214328Z","title":"Jaehyung Kim, Yuning Mao, Rui Hou, Hanchao Yu, Davis Liang, Pascale Fung, Qifan Wang, Fuli Feng, Lifu Huang, and Madian Khabsa","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.214328Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:6c69a07e9d2e25906d99d01c534066ca527966fb7c017d2355b8cd4e79bd9cf6","observation_id":"7b7e2e8a-0254-4e22-bd8b-1d9f857deceb","resolution":{"observed_at":"2026-08-06T23:59:56.214328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01552","last_updated":"2023-12-04T00:46:11Z","snapshot_observed_at":"2026-08-07T00:42:49.627314Z","submitted_at":"2023-12-04T00:46:11Z","title":"The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01552","snapshot_observed_at":"2026-08-06T23:59:56.327320Z","title":"The unlocking spell on base llms: Rethinking alignment via in-context learning.arXiv preprint arXiv:2312.01552,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.327320Z"},"links":{"cited_paper":"/paper/2312.01552","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:5c9b63ab13f9f3b18d4d68da6b150237fe447d1f17d5d1ec8b0bbbd4b3f087f7","observation_id":"f9689af8-987e-4d55-883f-e9c6b49995e2","resolution":{"observed_at":"2026-08-06T23:59:56.327320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19358","last_updated":"2024-05-31T02:09:51Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-24T04:50:38Z","title":"Robustifying Safety-Aligned Large Language Models through Clean Data Curation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19358","snapshot_observed_at":"2026-08-06T23:59:56.430016Z","title":"Robustifying safety-aligned large language models through clean data curation.arXiv preprint arXiv:2405.19358,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.430016Z"},"links":{"cited_paper":"/paper/2405.19358","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:4134340162d125e38a071e2a5e3dd3e7e39e3f706346a995ff979a75269c4af9","observation_id":"4af70bc5-9a73-4257-b581-701f3804edc8","resolution":{"observed_at":"2026-08-06T23:59:56.430016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12833","last_updated":"2023-08-24T14:45:50Z","snapshot_observed_at":"2026-07-06T16:09:59.750388Z","submitted_at":"2023-08-24T14:45:50Z","title":"Use of LLMs for Illicit Purposes: Threats, Prevention Measures, and Vulnerabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12833","snapshot_observed_at":"2026-08-06T23:59:56.464742Z","title":"Use of llms for illicit purposes: Threats, prevention measures, and vulnerabilities.arXiv preprint arXiv:2308.12833,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.464742Z"},"links":{"cited_paper":"/paper/2308.12833","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:6fc35d2aa19929178f4474a80168f967feabb7d4d647a0f6910d80b94c55ad5a","observation_id":"44c79d5e-b731-4f64-99df-022103abe32d","resolution":{"observed_at":"2026-08-06T23:59:56.464742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13320","last_updated":"2024-07-01T17:14:27Z","snapshot_observed_at":"2026-07-06T16:10:23.328130Z","submitted_at":"2023-08-25T11:49:51Z","title":"Fine-tuning can cripple your foundation model; preserving features may be the solution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13320","snapshot_observed_at":"2026-08-06T23:59:56.539321Z","title":"Fine-tuning can crip- ple your foundation model; preserving features may be the solution.arXiv preprint arXiv:2308.13320,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.539321Z"},"links":{"cited_paper":"/paper/2308.13320","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:656617686587e1f51a378fe3539fc5ecc2eaeebc163ed046bcd5dd14da2b6244","observation_id":"8ef1edc8-d825-473e-9a00-c70a715886c3","resolution":{"observed_at":"2026-08-06T23:59:56.539321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:59:56.661089Z","title":"Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.661089Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:a82715e5f049026cdc8fb2d4ce77571f073175039c5d51105c0724f2089d85f2","observation_id":"fe1cb680-efc2-46f1-8f95-92bdad269973","resolution":{"observed_at":"2026-08-06T23:59:56.661089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-06T23:59:56.806561Z","title":"Red teaming language models with language models.arXiv preprint arXiv:2202.03286,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.806561Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:f826fb46e70d2de2288e27e7e01280adae36ad465d023b35c6349a5c78a28b66","observation_id":"2ea3413d-f36c-41d0-865e-7460a6dde878","resolution":{"observed_at":"2026-08-06T23:59:56.806561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14968","last_updated":"2024-06-20T05:18:04Z","snapshot_observed_at":"2026-07-06T17:34:20.247808Z","submitted_at":"2024-02-22T21:05:18Z","title":"Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14968","snapshot_observed_at":"2026-08-06T23:59:56.867587Z","title":"Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment.arXiv preprint arXiv:2402.14968,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.867587Z"},"links":{"cited_paper":"/paper/2402.14968","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:b02215f468c6731e5ff9476a8539224bdb71f64b2f16549a5270e29969e9cca0","observation_id":"9220a8f9-c9e5-46fc-8905-9519f83138e7","resolution":{"observed_at":"2026-08-06T23:59:56.867587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16792","last_updated":"2025-05-30T04:58:07Z","snapshot_observed_at":"2026-07-06T18:05:42.862609Z","submitted_at":"2024-04-25T17:39:50Z","title":"Model Extrapolation Expedites Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16792","snapshot_observed_at":"2026-08-06T23:59:57.259827Z","title":"Weak-to-strong extrapolation expedites alignment.arXiv preprint arXiv:2404.16792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.259827Z"},"links":{"cited_paper":"/paper/2404.16792","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:c8219eda0d5a7821adca3a4fa1cbb328ccd662878b49ff467c29db3865cb8224","observation_id":"cdf18a32-93eb-43b0-8018-ec1683e8b1d8","resolution":{"observed_at":"2026-08-06T23:59:57.259827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-07T10:51:37.619464Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-06T23:59:57.357277Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models.arXiv preprint arXiv:2402.02207,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.357277Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:33eaf08e348188e6cad3b2a045d806f170c34cb674a8dcd9da3fa42e4ff1a73b","observation_id":"e8bbe007-6169-48fa-8d86-030ac4ed2cb4","resolution":{"observed_at":"2026-08-06T23:59:57.357277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T23:59:57.417182Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.417182Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:3950126c11787d0b0b92bb2e80e5619082f46ac6320f191a645ec277993af724","observation_id":"d7e542b3-4915-4b0f-96d5-d0b1bd9ca74b","resolution":{"observed_at":"2026-08-06T23:59:57.417182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.907186Z","title":"Similar to RIFT, RoAST can be categorized as a fine-tuning stage defense, and therefore is also not suitable for the scenario described","venue":null,"work_id":"88d625f1-88d4-4cf7-aa9b-3b47df26dab0","year":2022},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.532604Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:04c2ff55f985bb8d60c7019f97a191eee9a8472434f7a603a57dbaa8d4342f37","observation_id":"0661f49f-101a-41e5-9eca-3773a6fe15ef","resolution":{"observed_at":"2026-08-07T00:00:02.053821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.412073Z","title":"Absolutely Obedient","venue":null,"work_id":"2b4baeef-1657-459f-ab49-641da580bfa3","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.721181Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:a8483433a147080ba3db4f54a3dc797eee27bece762ba9617cab69034ae46938","observation_id":"1d0977e8-b7cd-4f02-a3ef-b856ebc2bbdf","resolution":{"observed_at":"2026-08-07T00:00:01.511263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.245483Z","title":"Pure Bad.The Pure Bad dataset consists of 100 harmful examples, extracted from the Anthropic Red Teaming Dataset (Ganguli et al., 2022)","venue":null,"work_id":"87c2c88c-a952-450c-80af-60dfff3ba496","year":2022},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.801619Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:a13ac249ee211f9f2b694c80e660288be9881e2fa60f21263439f8420859316b","observation_id":"5044b574-3f90-44e4-94a8-fc3683c08e2e","resolution":{"observed_at":"2026-08-07T00:00:01.311559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.924336Z","title":null,"venue":null,"work_id":"d1fb674e-afd2-49f9-86f6-705f1cf88598","year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.009728Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:e5ea45321195f4dfc1cdb8eb93bd2a14ba57235114bb811cf468c4aeac04df44","observation_id":"57d95072-760a-472a-9eb4-a7975e5adee5","resolution":{"observed_at":"2026-08-07T00:00:01.078057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.723060Z","title":"5, and extrapolating further (which we considered broken), following (Lin et al., 2023)","venue":null,"work_id":"419379d4-d173-4344-98fb-7c3278df19be","year":2024},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.129917Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:dd2f009e4598a9b4c95359cc99f33f9445e00ed8e014a9fe972a73cca4f64403","observation_id":"d30f529e-ab95-46dc-a827-5232a6e9eb52","resolution":{"observed_at":"2026-08-07T00:00:00.840892Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.270847Z","title":"We include Meta’s usage guidelines1 in our prompt, following the evaluation protocol of Qi et al","venue":null,"work_id":"95c573df-1bf6-40b2-9d69-6bcec3650dc9","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.303211Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:db976e00dc4cb577da81e1d2dc2a9c7ef3436b81e3f4cbb37e7f0a591c820a1f","observation_id":"74c87f94-dbf0-43da-9f53-33c61064ac15","resolution":{"observed_at":"2026-08-07T00:00:00.388349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.094768Z","title":"No\" Response(k=6,α=1.5): “Your task is to complete tasks for people is not recommended","venue":null,"work_id":"b944d173-cfbf-4ed0-ad2b-9cb4594dd7ef","year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.413814Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:3f41d1e30e76fe44f1be030eeeaf20c61731d20e7a3b659caaf1d65a35eb7abe","observation_id":"c9692a5e-b101-4f08-a28c-0d776e7391c4","resolution":{"observed_at":"2026-08-07T00:00:00.202159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.675424Z","title":null,"venue":null,"work_id":"50605347-a846-4674-b01b-a666d50796dc","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.615080Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:f8220c41d3e735757ae886c706ad98c423ed7c3ce886f828a533288c4b7b11f4","observation_id":"a00007b1-ff82-47a3-a550-603b29d4d067","resolution":{"observed_at":"2026-08-07T00:00:01.806107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12148","last_updated":"2023-12-19T13:31:24Z","snapshot_observed_at":"2026-07-06T17:05:19.007669Z","submitted_at":"2023-12-19T13:31:24Z","title":"Parameter-Efficient Fine-Tuning Methods for Pretrained Language Models: A Critical Review and Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12148","snapshot_observed_at":"2026-08-06T23:59:57.134832Z","title":"Parameter- efficient fine-tuning methods for pretrained language models: A critical review and assessment.arXiv preprint arXiv:2312.12148,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.134832Z"},"links":{"cited_paper":"/paper/2312.12148","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:91a0ba63e1991c52c3c61923ce0bd3a8125ce4f18a162ce3966ceaf467208e66","observation_id":"b71990e6-68f0-4e20-9c57-5b69d7972036","resolution":{"observed_at":"2026-08-06T23:59:57.134832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-06T23:59:55.560201Z","title":"Self-play fine- tuning converts weak language models to strong language models.arXiv preprint arXiv:2401.01335,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.560201Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:77e0f93fde03ddcbb77a9e6a15f85001c28993bf15e948bc0bc38f74df7437b4","observation_id":"c3dd5955-0634-471c-906a-271f06b94965","resolution":{"observed_at":"2026-08-06T23:59:55.560201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-08-06T23:45:57.910675Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-08-06T23:59:55.503290Z","title":"Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions.arXiv preprint arXiv:2309.07875,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.503290Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:15a72c3b7b0a84634fcd40496387770a1bab8aae8fc9a1952f712184ca631030","observation_id":"ed87a7e4-93cb-482a-976a-57b3b42fc5a7","resolution":{"observed_at":"2026-08-06T23:59:55.503290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:02.158329Z","title":"Xinshuai Dong, Anh Tuan Luu, Min Lin, Shuicheng Yan, and Hanwang Zhang","venue":null,"work_id":"99202421-329b-48be-b743-fccc440565de","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.714750Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:d3edfe9f4702f3eca16e7df47176f7bc9e3cc3fd8b670bebe9625aa9b4225092","observation_id":"96de15c3-91af-4fc2-8b70-29d0d129cb93","resolution":{"observed_at":"2026-08-07T00:00:02.261337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T23:59:55.454095Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.454095Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:d577388db8f30bc7390606815d15be8d43aed4c59929e4d52d6b7985fe83ad35","observation_id":"f948c392-9160-4e76-bb23-1f01999edd5b","resolution":{"observed_at":"2026-08-06T23:59:55.454095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-06T23:59:57.027070Z","title":"Crowdsourcing multiple choice science questions.arXiv preprint arXiv:1707.06209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.027070Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:4b7346e7c0bd28dbcf3021d90161333a47b7ce4c3fa6d8214e43f76ae4ceb399","observation_id":"ce426289-9b95-4344-a6ca-35b38b0d5789","resolution":{"observed_at":"2026-08-06T23:59:57.027070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:50:07.932376Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 3 inbound Pith citation observations for arXiv:2506.15606."}