{"as_of":"2026-08-22T04:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fb3ae892e057cd9ae771e9b1355f681366a363cb9c478701625d0959aec785d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T05:21:30.132993Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11475/citation-record","integrity":"/paper/2607.11475/integrity","json":"/paper/2607.11475/citation-record.json","paper":"/paper/2607.11475"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:bb597b5b1a388dcc59c873dc77be3e6d46950678adb7e6404d16190e6af39ded","observation_id":"c07110e2-2969-4442-868e-98d365be6268","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:1f434611f6e1acb2ce34bafc35909d244a69aa713d0594dfa0068904bd61f975","observation_id":"c928cdbd-4db0-4015-be5d-edff62e95a99","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Lisa: Lazy safety alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:8b83d877031c6f089b1e24cc582666bfb2e9afb4a1251a274c04714fbd818c87","observation_id":"9d563caf-1460-42b2-b935-43fafe2c5554","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Representation noising: A defence mechanism against harmful finetuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:5e2a24f5b2e4b60693b0e0a5f135c5c8a2f7d2cf88dcf2eadd79a749e93dac88","observation_id":"7e7d8cdc-268f-44f9-a607-326b04d3700b","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Safe LoRA: The silver lining of reducing safety risks when fine-tuning large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:4b59e8f352571268dabd681408231fbbdbc1adfb8942bbb5070c001f9119284f","observation_id":"0b47ad0e-5e76-48fb-be7c-dff62e15b6fb","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Safety at one shot: Patching fine-tuned LLMs with a single instance","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:426cf0b56c928edd8eb1aa5d02ac294fa1dff3c6f394de356d6203f55b82b5c2","observation_id":"a18c6944-241d-4d35-99be-70adbf265e91","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:c9fe4ea5991d01425d605262ec9fb358909e874a1abc3cedc8aa9ed5707a4017","observation_id":"cb4516ea-b4d3-4376-9a15-5b469ba0de62","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Llama Guard: LLM-based input-output safeguard for human-AI conversations.arXiv preprint arXiv:2312.06674, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:e18d4918b2c4180f747d2edbdaed66b6ca7fdc7834672f750bf88495295df38f","observation_id":"84fa6f04-1b9b-4a18-842e-e72fda1c11ba","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-12T20:12:20.465098Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"WildGuard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of LLMs.arXiv preprint arXiv:2406.18495, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:9da2c6e46a41fc4db00e41e871c6c7a715b5d25ae03d85d225bddedb486de29c","observation_id":"98e0a8fc-8db3-4ed7-b23d-4e9e6490c449","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07724","last_updated":"2024-12-16T20:27:36Z","snapshot_observed_at":"2026-08-14T13:29:11.901741Z","submitted_at":"2024-12-10T18:17:02Z","title":"Granite Guardian","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07724","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Granite Guardian.arXiv preprint arXiv:2412.07724, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2412.07724","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:de6329123f6d0897e520e4eb031df0973d8271333d87b120d101cd6845185a4a","observation_id":"3b783caa-c649-4cf4-8e97-3c668c3d182a","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:f0a04ad63402a869671be6cd79f1ee77a15e588883b3c1fea574546726501b80","observation_id":"05191924-c973-4ad3-b526-e757b5634d00","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Safety-tuned LLaMAs: Lessons from improving the safety of large language models that follow instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:3f8b3968d583634191732d4496994b889ca1f4e16f59bdbe167cc1756f2eecee","observation_id":"5da82233-f7db-4e93-bec7-fcb4ca380c9b","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:f21fcf50ebb3eedfd8db3d44c9d03c28c9d66909155536fe3fc0e9b48b13a238","observation_id":"ae4db2e4-3a9c-49f8-801a-51f8daf003f0","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:d228806485771fcf5d9e2fe8ef3682ff69f7f0d14126bf7d15f730267bf581ea","observation_id":"dd7eb379-fdd1-4629-9a64-a3ac2a4612ce","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:7dee61415a537668bfbc08132055b087f87f8112da4b516a3bc97f1f7c31f853","observation_id":"e9eca68e-e963-412d-b998-38e064ed5790","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:5469d589bebb85dd7dd08236f503c5416b416eb4e4cd60dc665b2f5c7150fee2","observation_id":"03bbafa9-ee6d-405c-80b8-0280ee34ee0f","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:957a0ee0809fc860f45a3eb5f33b65edd66a4d42aad2012e331f1ec7c33af723","observation_id":"40583a79-7b9e-459d-aab6-16c3c6e5505b","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Constitutional AI: Harmlessness from AI feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:3cd049e38a1c1793f3b4a64da9276f587fe27dcea21647ad1bfa987ec32e0721","observation_id":"877242e2-0df6-4f71-87b4-848580998d3e","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:7ff9456096e780bec3ae560e5c5e825dfb2a0a5d7ab52c81f02a5b654c8ffeea","observation_id":"71524d68-05c1-4572-9b33-dd09b19e6a93","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:7de3d856574431e9dcb1fea37b9412e401e1742b26a5b957bfee111981b580cd","observation_id":"1ea002f3-ab18-4c3a-a54e-ad1cc87b4f0f","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:80ee4d80b07aef3224915b81907df5e4ae3e58272e7db5506eba53af15f3b0f8","observation_id":"5f180efd-54ba-4654-9549-1e8b2accf6aa","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:d5bffeef33644c1e68e207bebfbc8d2cfb6e693ae421063967c9278a2c8d7f6f","observation_id":"0d07ebb2-b144-496f-96f6-23ce61d27c18","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Fraser, Hillary Dawkins, Isar Nejadgholi, and Svetlana Kiritchenko","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:e90646d759cccb5a6de9ad68503c8fa7ef50f1277350c60b8d2978f63788bdda","observation_id":"f74866dd-c3bb-439e-bd18-986f2c40858e","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"LoRA fine-tuning efficiently undoes safety training in Llama 2-Chat 70B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:2e7999c5a51ea1352df6e49385313c2d09859a091fde2c3bad9ce39093bc4a37","observation_id":"09230b7e-e5b8-4880-bf7e-c8d2c97b186c","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Removing RLHF protections in GPT-4 via fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:bfe632052ab9315af03e47b2808c41cc96479f2d15a3945b1a7a575d7cc3707d","observation_id":"4974b58c-f410-4f5c-a1b1-98ab6c6dd27d","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01586","last_updated":"2025-03-17T17:17:16Z","snapshot_observed_at":"2026-08-18T10:24:10.887783Z","submitted_at":"2024-09-03T03:59:22Z","title":"Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01586","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Booster: Tackling harmful fine-tuning for large language models via attenuating harmful perturbation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2409.01586","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:b4a91e64d7ec32efdfcd324a75c34fb5c76ab40fa3ee2d3beae12f68bec0eb73","observation_id":"0bee95b9-158f-44c2-a685-f6661945d8cc","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"TIES-merging: Resolving interference when merging models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:294d0a8d2d9e2c620f1702f9e96ec12258a10b214eb4b57265a608c3c7ed7dde","observation_id":"f714f8b9-5742-44f6-8617-3a6858393337","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Language models are homer simpson! safety re-alignment of fine-tuned language models through task arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:c4f4184f165c29202d0eb90ae98c85da30392038889fe7a02f60caa86417a153","observation_id":"804b7d9e-0507-4857-bd08-4dfc01df6563","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:a3640fb694edeecbb7fad3b68f397f9e9d71d53c296c86f3b83ae895806144dd","observation_id":"8e69fe6d-d765-4a68-9824-9f27f0eb1975","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-08-19T02:59:43.798238Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21772","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"ShieldGemma: Generative AI content moderation based on Gemma","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2407.21772","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:d3065dc4408d2abee87612bf9f85081131ff50df0117ff99efdf2bf8678e07a7","observation_id":"337424df-419c-42e3-bd92-b6f4bd8f8c1a","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05993","last_updated":"2024-09-11T14:42:29Z","snapshot_observed_at":"2026-08-22T03:42:00.219266Z","submitted_at":"2024-04-09T03:54:28Z","title":"AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05993","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"AEGIS: On- line adaptive AI content safety moderation with ensemble of LLM experts.arXiv preprint arXiv:2404.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2404.05993","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:21420292544bdd2592394054d94f70bcc0207ca9da13aff1f256ec94a3700bd1","observation_id":"73d0fa2d-a920-49ff-a1d6-3683f8d3d691","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"A holistic approach to undesired content detection in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:5eb442197664f82099b8fd785dbf11826594cdc9ec611d0137dbe2441712c988","observation_id":"6efa4a77-78b3-4ed0-ab0b-afc0ca2985ff","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"A new generation of Perspective API: Efficient multilingual character-level transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:416c0304b0e302648b10d487835406a51583bc369ea26e73f242ce7f2a7107f1","observation_id":"2b8e818a-43d9-485f-920f-fb654092d434","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"HiddenDetect: Detecting jailbreak attacks against multimodal large language models via monitoring hidden states","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:ae85eb05c8513a4c88bd870234560236b3280cb6a6aedec37f6026d2d27ccd6a","observation_id":"c32e5c7e-39a4-46be-9a94-05b06f5f98d2","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"The internal state of an LLM knows when it’s lying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:6dd169c9c780974e2d1b7c69319b9946ed07fd682a3a8aa0b5892d5b2ebaa8f1","observation_id":"b8100717-1401-4962-a528-44796c5d841d","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:44d8ccf4d0a3a83fd128fc871de1351bd7dda22bb0f00bcd37cd224338ab2ad2","observation_id":"bfcfc93d-377a-4c07-aca2-2927dae5ec29","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Representation engineering: A top-down approach to AI transparency.arXiv preprint arXiv:2310.01405, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:4c6e57be38b13c5139f40adde013d370b4f41b5bfb0d06c4ed184cdcd1088aa1","observation_id":"71825118-52a0-4184-af1f-37694b1f1fa4","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:de7cad85d98f84b02b4b3b07a3ee4e2262f20b7a901c63239b2958b96ca45dc3","observation_id":"89f54519-1a35-44b6-8409-86e37f567edb","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"A brief review of hypernetworks in deep learning.Artificial Intelligence Review, 57(9):250, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:83af4ff01e45cc8ce0b68513c9c4eda50d1b301041d6fa8883d7054e42a911b4","observation_id":"d5beb94f-d4e3-44c4-8708-8589444dbd08","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Continual learning with hypernetworks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:c83144dca3b4cc8d11ddc2e09ac40662dff092d51eaa2c81bbd0bb3158905898","observation_id":"81ba8e0b-a414-4a1f-b949-a8e8741ab3a6","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Equivariant architectures for learning in deep weight spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:2d0b80d6620d06baf7bd063447d20b39c9d1d384006456e75ff17eac9691635c","observation_id":"c6c67a91-971d-46d9-aa7e-108ee18e7cb9","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"HyperTuning: Toward adapting large language models without back-propagation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:eb8ac99ba1caf39c6fcffdffe16ff0315393cbf68b779582db8cd20f84f46186","observation_id":"0a4e1342-1992-408f-b54c-94da3765a9ed","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:7d85a680fc2226d4a903c668813b50f62e8dc3d0527d074d637775eefe0a0aa6","observation_id":"ff055df4-24a2-4dfa-8cfd-dfbe632c75b2","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Parameter prediction for unseen deep architectures","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:abf302f54e377ae740b0d22d1f80068dc476865be63e3d9705e812005b5bffca","observation_id":"f994dd60-0eb9-4e85-a08c-24a4251896c6","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16406","last_updated":"2025-06-19T15:38:21Z","snapshot_observed_at":"2026-08-16T04:39:21.535380Z","submitted_at":"2025-06-19T15:38:21Z","title":"Drag-and-Drop LLMs: Zero-Shot Prompt-to-Weights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16406","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Bronstein, Yang You, Zhangyang Wang, and Kai Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2506.16406","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:386c030b216dfb260e83d89187dff9c87861cc972c223e3c217d59d585311f08","observation_id":"5dd87627-6cc1-4354-bbe1-e53f944fb518","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"LST: Ladder side-tuning for parameter and memory efficient transfer learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:e82b2f85b7f12455ec7ca0c6fc2d012301bf97390135e74546d9756b93d4e42b","observation_id":"457e8930-1a63-4aa1-afd7-d96876c8e687","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:5090cc4a19e8dc635617d6b99859ffd65fa88c52376eb5a85b6cf5c6b836b2ad","observation_id":"6adbd0c7-9aae-4642-965a-d307e059fb56","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"BeaverTails: Towards improved safety alignment of LLM via a human-preference dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:272b56e1bb1e859bde7dc8fe840997077a815042caa8cc6cf90ea73552e9f686","observation_id":"f50c7fb4-3f5f-4e92-86c8-fb336ea3f131","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-14T05:21:30.132993Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T05:21:30.132993Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2607.11475"},"observation_digest":"sha256:9a0dbee7f248269c4fb50bfec729d86a5a173597f1cd847d09e9e60c4352281f","observation_id":"d43f8798-f7ac-4c67-909a-2569ba31694b","resolution":{"observed_at":"2026-07-14T05:21:30.132993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11475","last_updated":"2026-07-13T12:28:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T17:25:32.834750Z","submitted_at":"2026-07-13T12:28:43Z","title":"HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2607.11475."}