Pith. sign in

Paper Citation Record · LEDGER

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

As of 22 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2607.11475.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.11475 v1

Coverage vector

measured 49 of 49 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-14T05:21:30.132993Z

measured 49 of 49 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

49 of 49 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved48
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c07110e2-2969-4442-868e-98d365be6268 · outbound

This paper cites Fine-tuning aligned language models compromises safety, even when users do not intend to.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Fine-tuning aligned language models compromises safety, even when users do not intend to

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:bb597b5b1a388dcc59c873dc77be3e6d46950678adb7e6404d16190e6af39ded

Observation c928cdbd-4db0-4015-be5d-edff62e95a99 · outbound

This paper cites Safety alignment should be made more than just a few tokens deep.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Safety alignment should be made more than just a few tokens deep

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:1f434611f6e1acb2ce34bafc35909d244a69aa713d0594dfa0068904bd61f975

Observation 9d563caf-1460-42b2-b935-43fafe2c5554 · outbound

This paper cites Lisa: Lazy safety alignment for large language models against harmful fine-tuning attack.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Lisa: Lazy safety alignment for large language models against harmful fine-tuning attack

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:8b83d877031c6f089b1e24cc582666bfb2e9afb4a1251a274c04714fbd818c87

Observation 7e7d8cdc-268f-44f9-a607-326b04d3700b · outbound

This paper cites Representation noising: A defence mechanism against harmful finetuning.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Representation noising: A defence mechanism against harmful finetuning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:5e2a24f5b2e4b60693b0e0a5f135c5c8a2f7d2cf88dcf2eadd79a749e93dac88

Observation 0b47ad0e-5e76-48fb-be7c-dff62e15b6fb · outbound

This paper cites Safe LoRA: The silver lining of reducing safety risks when fine-tuning large language models.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Safe LoRA: The silver lining of reducing safety risks when fine-tuning large language models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:4b59e8f352571268dabd681408231fbbdbc1adfb8942bbb5070c001f9119284f

Observation a18c6944-241d-4d35-99be-70adbf265e91 · outbound

This paper cites Safety at one shot: Patching fine-tuned LLMs with a single instance.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Safety at one shot: Patching fine-tuned LLMs with a single instance

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:426cf0b56c928edd8eb1aa5d02ac294fa1dff3c6f394de356d6203f55b82b5c2

Observation cb4516ea-b4d3-4376-9a15-5b469ba0de62 · outbound

This paper cites Editing models with task arithmetic.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Editing models with task arithmetic

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:c9fe4ea5991d01425d605262ec9fb358909e874a1abc3cedc8aa9ed5707a4017

Observation 84fa6f04-1b9b-4a18-842e-e72fda1c11ba · outbound

This paper cites Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:e18d4918b2c4180f747d2edbdaed66b6ca7fdc7834672f750bf88495295df38f

Observation 98e0a8fc-8db3-4ed7-b23d-4e9e6490c449 · outbound

This paper cites WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:9da2c6e46a41fc4db00e41e871c6c7a715b5d25ae03d85d225bddedb486de29c

Observation 3b783caa-c649-4cf4-8e97-3c668c3d182a · outbound

This paper cites Granite Guardian.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Granite Guardian

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:de6329123f6d0897e520e4eb031df0973d8271333d87b120d101cd6845185a4a

Observation 05191924-c973-4ad3-b526-e757b5634d00 · outbound

This paper cites Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:f0a04ad63402a869671be6cd79f1ee77a15e588883b3c1fea574546726501b80

Observation 5da82233-f7db-4e93-bec7-fcb4ca380c9b · outbound

This paper cites Safety-tuned LLaMAs: Lessons from improving the safety of large language models that follow instructions.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Safety-tuned LLaMAs: Lessons from improving the safety of large language models that follow instructions

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:3f8b3968d583634191732d4496994b889ca1f4e16f59bdbe167cc1756f2eecee

Observation ae4db2e4-3a9c-49f8-801a-51f8daf003f0 · outbound

This paper cites The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:f21fcf50ebb3eedfd8db3d44c9d03c28c9d66909155536fe3fc0e9b48b13a238

Observation dd7eb379-fdd1-4629-9a64-a3ac2a4612ce · outbound

This paper cites Training language models to follow instructions with human feedback.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Training language models to follow instructions with human feedback

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:d228806485771fcf5d9e2fe8ef3682ff69f7f0d14126bf7d15f730267bf581ea

Observation e9eca68e-e963-412d-b998-38e064ed5790 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:7dee61415a537668bfbc08132055b087f87f8112da4b516a3bc97f1f7c31f853

Observation 03bbafa9-ee6d-405c-80b8-0280ee34ee0f · outbound

This paper cites Learning to summarize with human feedback.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Learning to summarize with human feedback

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:5469d589bebb85dd7dd08236f503c5416b416eb4e4cd60dc665b2f5c7150fee2

Observation 40583a79-7b9e-459d-aab6-16c3c6e5505b · outbound

This paper cites Deep reinforcement learning from human preferences.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Deep reinforcement learning from human preferences

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:957a0ee0809fc860f45a3eb5f33b65edd66a4d42aad2012e331f1ec7c33af723

Observation 877242e2-0df6-4f71-87b4-848580998d3e · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:3cd049e38a1c1793f3b4a64da9276f587fe27dcea21647ad1bfa987ec32e0721

Observation 71524d68-05c1-4572-9b33-dd09b19e6a93 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Direct preference optimization: Your language model is secretly a reward model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:7ff9456096e780bec3ae560e5c5e825dfb2a0a5d7ab52c81f02a5b654c8ffeea

Observation 1ea002f3-ab18-4c3a-a54e-ad1cc87b4f0f · outbound

This paper cites The Llama 3 Herd of Models.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models The Llama 3 Herd of Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:7de3d856574431e9dcb1fea37b9412e401e1742b26a5b957bfee111981b580cd

Observation 5f180efd-54ba-4654-9549-1e8b2accf6aa · outbound

This paper cites Qwen2 Technical Report.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Qwen2 Technical Report

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:80ee4d80b07aef3224915b81907df5e4ae3e58272e7db5506eba53af15f3b0f8

Observation 0d07ebb2-b144-496f-96f6-23ce61d27c18 · outbound

This paper cites Assessing the brittleness of safety alignment via pruning and low-rank modifications.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Assessing the brittleness of safety alignment via pruning and low-rank modifications

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:d5bffeef33644c1e68e207bebfbc8d2cfb6e693ae421063967c9278a2c8d7f6f

Observation f74866dd-c3bb-439e-bd18-986f2c40858e · outbound

This paper cites Fraser, Hillary Dawkins, Isar Nejadgholi, and Svetlana Kiritchenko.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Fraser, Hillary Dawkins, Isar Nejadgholi, and Svetlana Kiritchenko

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:e90646d759cccb5a6de9ad68503c8fa7ef50f1277350c60b8d2978f63788bdda

Observation 09230b7e-e5b8-4880-bf7e-c8d2c97b186c · outbound

This paper cites LoRA fine-tuning efficiently undoes safety training in Llama 2-Chat 70B.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models LoRA fine-tuning efficiently undoes safety training in Llama 2-Chat 70B

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:2e7999c5a51ea1352df6e49385313c2d09859a091fde2c3bad9ce39093bc4a37

Observation 4974b58c-f410-4f5c-a1b1-98ab6c6dd27d · outbound

This paper cites Removing RLHF protections in GPT-4 via fine-tuning.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Removing RLHF protections in GPT-4 via fine-tuning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:bfe632052ab9315af03e47b2808c41cc96479f2d15a3945b1a7a575d7cc3707d

Observation 0bee95b9-158f-44c2-a685-f6661945d8cc · outbound

This paper cites Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:b4a91e64d7ec32efdfcd324a75c34fb5c76ab40fa3ee2d3beae12f68bec0eb73

Observation f714f8b9-5742-44f6-8617-3a6858393337 · outbound

This paper cites TIES-merging: Resolving interference when merging models.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models TIES-merging: Resolving interference when merging models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:294d0a8d2d9e2c620f1702f9e96ec12258a10b214eb4b57265a608c3c7ed7dde

Observation 804b7d9e-0507-4857-bd08-4dfc01df6563 · outbound

This paper cites Language models are homer simpson! safety re-alignment of fine-tuned language models through task arithmetic.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Language models are homer simpson! safety re-alignment of fine-tuned language models through task arithmetic

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:c4f4184f165c29202d0eb90ae98c85da30392038889fe7a02f60caa86417a153

Observation 8e69fe6d-d765-4a68-9824-9f27f0eb1975 · outbound

This paper cites Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:a3640fb694edeecbb7fad3b68f397f9e9d71d53c296c86f3b83ae895806144dd

Observation 337424df-419c-42e3-bd92-b6f4bd8f8c1a · outbound

This paper cites ShieldGemma: Generative AI Content Moderation Based on Gemma.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models ShieldGemma: Generative AI Content Moderation Based on Gemma

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:d3065dc4408d2abee87612bf9f85081131ff50df0117ff99efdf2bf8678e07a7

Observation 73d0fa2d-a920-49ff-a1d6-3683f8d3d691 · outbound

This paper cites AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:21420292544bdd2592394054d94f70bcc0207ca9da13aff1f256ec94a3700bd1

Observation 6efa4a77-78b3-4ed0-ab0b-afc0ca2985ff · outbound

This paper cites A holistic approach to undesired content detection in the real world.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models A holistic approach to undesired content detection in the real world

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:5eb442197664f82099b8fd785dbf11826594cdc9ec611d0137dbe2441712c988

Observation 2b8e818a-43d9-485f-920f-fb654092d434 · outbound

This paper cites A new generation of Perspective API: Efficient multilingual character-level transformers.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models A new generation of Perspective API: Efficient multilingual character-level transformers

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:416c0304b0e302648b10d487835406a51583bc369ea26e73f242ce7f2a7107f1

Observation c32e5c7e-39a4-46be-9a94-05b06f5f98d2 · outbound

This paper cites HiddenDetect: Detecting jailbreak attacks against multimodal large language models via monitoring hidden states.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models HiddenDetect: Detecting jailbreak attacks against multimodal large language models via monitoring hidden states

Reference 34

Resolution
malformed identifier
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:ae85eb05c8513a4c88bd870234560236b3280cb6a6aedec37f6026d2d27ccd6a

Observation b8100717-1401-4962-a528-44796c5d841d · outbound

This paper cites The internal state of an LLM knows when it’s lying.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models The internal state of an LLM knows when it’s lying

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:6dd169c9c780974e2d1b7c69319b9946ed07fd682a3a8aa0b5892d5b2ebaa8f1

Observation bfcfc93d-377a-4c07-aca2-2927dae5ec29 · outbound

This paper cites Refusal in language models is mediated by a single direction.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Refusal in language models is mediated by a single direction

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:44d8ccf4d0a3a83fd128fc871de1351bd7dda22bb0f00bcd37cd224338ab2ad2

Observation 71825118-52a0-4184-af1f-37694b1f1fa4 · outbound

This paper cites Representation Engineering: A Top-Down Approach to AI Transparency.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Representation Engineering: A Top-Down Approach to AI Transparency

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:4c6e57be38b13c5139f40adde013d370b4f41b5bfb0d06c4ed184cdcd1088aa1

Observation 89f54519-1a35-44b6-8409-86e37f567edb · outbound

This paper cites an unresolved cited work.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Unresolved cited work

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:de7cad85d98f84b02b4b3b07a3ee4e2262f20b7a901c63239b2958b96ca45dc3

Observation d5beb94f-d4e3-44c4-8708-8589444dbd08 · outbound

This paper cites A brief review of hypernetworks in deep learning.Artificial Intelligence Review, 57(9):250, 2024.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models A brief review of hypernetworks in deep learning.Artificial Intelligence Review, 57(9):250, 2024

Reference 39

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:83af4ff01e45cc8ce0b68513c9c4eda50d1b301041d6fa8883d7054e42a911b4

Observation 81ba8e0b-a414-4a1f-b949-a8e8741ab3a6 · outbound

This paper cites Continual learning with hypernetworks.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Continual learning with hypernetworks

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:c83144dca3b4cc8d11ddc2e09ac40662dff092d51eaa2c81bbd0bb3158905898

Observation c6c67a91-971d-46d9-aa7e-108ee18e7cb9 · outbound

This paper cites Equivariant architectures for learning in deep weight spaces.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Equivariant architectures for learning in deep weight spaces

Reference 41

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:2d0b80d6620d06baf7bd063447d20b39c9d1d384006456e75ff17eac9691635c

Observation 0a4e1342-1992-408f-b54c-94da3765a9ed · outbound

This paper cites HyperTuning: Toward adapting large language models without back-propagation.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models HyperTuning: Toward adapting large language models without back-propagation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:eb8ac99ba1caf39c6fcffdffe16ff0315393cbf68b779582db8cd20f84f46186

Observation ff055df4-24a2-4dfa-8cfd-dfbe632c75b2 · outbound

This paper cites Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:7d85a680fc2226d4a903c668813b50f62e8dc3d0527d074d637775eefe0a0aa6

Observation f994dd60-0eb9-4e85-a08c-24a4251896c6 · outbound

This paper cites Parameter prediction for unseen deep architectures.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Parameter prediction for unseen deep architectures

Reference 44

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:abf302f54e377ae740b0d22d1f80068dc476865be63e3d9705e812005b5bffca

Observation 5dd87627-6cc1-4354-bbe1-e53f944fb518 · outbound

This paper cites Drag-and-Drop LLMs: Zero-Shot Prompt-to-Weights.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Drag-and-Drop LLMs: Zero-Shot Prompt-to-Weights

Reference 45

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:386c030b216dfb260e83d89187dff9c87861cc972c223e3c217d59d585311f08

Observation 457e8930-1a63-4aa1-afd7-d96876c8e687 · outbound

This paper cites LST: Ladder side-tuning for parameter and memory efficient transfer learning.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models LST: Ladder side-tuning for parameter and memory efficient transfer learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:e82b2f85b7f12455ec7ca0c6fc2d012301bf97390135e74546d9756b93d4e42b

Observation 6adbd0c7-9aae-4642-965a-d307e059fb56 · outbound

This paper cites LoRA: Low-rank adaptation of large language models.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models LoRA: Low-rank adaptation of large language models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:5090cc4a19e8dc635617d6b99859ffd65fa88c52376eb5a85b6cf5c6b836b2ad

Observation f50c7fb4-3f5f-4e92-86c8-fb336ea3f131 · outbound

This paper cites BeaverTails: Towards improved safety alignment of LLM via a human-preference dataset.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models BeaverTails: Towards improved safety alignment of LLM via a human-preference dataset

Reference 48

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:272b56e1bb1e859bde7dc8fe840997077a815042caa8cc6cf90ea73552e9f686

Observation d43f8798-f7ac-4c67-909a-2569ba31694b · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-14T05:21:30.132993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:21:30.132993Z digest=sha256:9a0dbee7f248269c4fb50bfec729d86a5a173597f1cd847d09e9e60c4352281f

Pith citing papers

No inbound Pith citation observations are available.