Pith. sign in

Paper Citation Record · LEDGER

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets

As of 21 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 3 inbound Pith citation observations for arXiv:2505.12038.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.12038 v1

Coverage vector

measured 74 of 74 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:48:09.637499Z

measured 77 of 77 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T22:05:50.798330Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-10T07:16:54.724748Z

Reference resolution

74 of 74 outbound references displayed

  • verified exact0
  • verified fuzzy59
  • unresolved15
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 06ffc698-e179-4fb5-922c-d448b4db6be2 · outbound

This paper cites write newline.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.358653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.358653Z digest=sha256:33fb5866c3a689b705be3cfd7d962b58047881b12abcfa304855cda3b232fdec

Observation 46a546d9-51bd-4dad-913a-cf81f75af7fb · outbound

This paper cites L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.552109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.363624Z digest=sha256:bed9cfd4dde73c27c51c65da9e61f300fff83fbcfabd806c4a9d76bdef76c37b

Observation 0bdb69e6-d1e0-4f7d-905f-288b38f35958 · outbound

This paper cites Claude, 2023.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Claude, 2023

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.539605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.368392Z digest=sha256:986e3bea103d0bd4d35eb563cd4ecaa70bfd404efb25afe887d76b7470f09ba4

Observation 85979a93-d15b-42b4-ae5e-20fe352ef81b · outbound

This paper cites A general language assistant as a laboratory for alignment.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets A general language assistant as a laboratory for alignment

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.526647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.372621Z digest=sha256:7970be4f5d1b1840ccdeb96c515a346afdada91660166cbf478f24b3b231b0e6

Observation 184b9299-358d-45fb-89fb-9c87f5706d87 · outbound

This paper cites Constitutional AI: harmlessness from AI feedback.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Constitutional AI: harmlessness from AI feedback

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.514850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.376420Z digest=sha256:cb841e2435641d9d22c28e83a60c3e53b83693e732cba5d08eddf1d27466a97c

Observation 7de6123d-b268-4f9c-8f53-370d9805674e · outbound

This paper cites D., and Poria, S.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets D., and Poria, S

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.502975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.380549Z digest=sha256:7f9fba51313fc18efecda31273cd089c5c0e25bc7e2b2d8abb0a37d686cc6c8d

Observation 38d03236-9914-44df-918c-960d9bfc47f6 · outbound

This paper cites Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.488195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.384550Z digest=sha256:b00ba71b6a1244ee7fa7ab8e23a6b8adfc17335c9f1a34031d7fd8c762183d9e

Observation fa1086ee-255c-4616-a977-f2ea6ed82add · outbound

This paper cites J., and Wong, E.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets J., and Wong, E

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.477575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.389520Z digest=sha256:dae44ca43be0ec30773542a3c8bbe75e1cdd74e4c1acdc2647807e9e417a12e2

Observation acd18528-edfc-427c-8929-2722a9c72dca · outbound

This paper cites and Kwok, J.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets and Kwok, J

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.465787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.392762Z digest=sha256:ea5672e63dfe1aacc795925eb583b42806d528e09c7fc13235bce8e78b72900a

Observation e48b2130-7171-4588-98e5-f23f26cb93a0 · outbound

This paper cites and Kwok, J.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets and Kwok, J

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.454447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.396274Z digest=sha256:1b9bef644546de4799ea6cefe5967a3711634fba240645a88dc4cae52f19fe99

Observation a5e6fff1-e35f-43c0-a540-53a4dd24305f · outbound

This paper cites and Kwok, J.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets and Kwok, J

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.442875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.400818Z digest=sha256:d5f14896539f564048003412b67323de8c3ac73fbb4ace41baa58abf920a196e

Observation 7bfa643f-d42e-46fe-8e9a-1b8f1e72874b · outbound

This paper cites an unresolved cited work.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:48:10.428658Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.404778Z digest=sha256:3985c309b3ccb98ad507f12f1eb844cb9ebfe5e8297d7986ac7d018418554402

Observation f205107a-4ad6-44de-bda6-b0db28b9257a · outbound

This paper cites Training verifiers to solve math word problems.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Training verifiers to solve math word problems

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.416587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.408339Z digest=sha256:edbea0e710b49416370a8699244d0fc4a8c01110d1eb913fbaa379a78c037540

Observation 2c527ac9-ed9f-4cff-96fa-1d918fb5ad4a · outbound

This paper cites Or-bench: An over-refusal benchmark for large language models.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Or-bench: An over-refusal benchmark for large language models

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.405043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.411823Z digest=sha256:a9a060365d2f0e6f5b10084596630d2020eb2812cbe8526e936ff256904c1c47

Observation 26e499eb-1a8c-4219-a467-bbc9ad733bd2 · outbound

This paper cites Safe RLHF: safe reinforcement learning from human feedback.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Safe RLHF: safe reinforcement learning from human feedback

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.392035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.415521Z digest=sha256:d258c756eb781d1bf55152321ce9ccf4a90adc8636d89166825515f1a26df983

Observation 1eaf2eb9-2079-4c79-8a6a-f6634c713ea2 · outbound

This paper cites and Alistarh, D.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets and Alistarh, D

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.380491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.419624Z digest=sha256:95ed1e06a8179fcb19c73ae8b47ed07a21e85796643d96a728c006287c5df184

Observation 555b25f4-bb92-44bf-8776-8b2c71721910 · outbound

This paper cites an unresolved cited work.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:48:10.368777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.423208Z digest=sha256:0cce67c095a3a4073a66a2bed5525a8e1b914fc890e6f7d96f21dcf7d3e4e722

Observation ea189a60-db91-41a0-8066-3b4fc6fbeb45 · outbound

This paper cites SAMS um corpus: A human-annotated dialogue dataset for abstractive summarization.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets SAMS um corpus: A human-annotated dialogue dataset for abstractive summarization

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.356192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.426450Z digest=sha256:ad588f3fd01b16fc6f0783c10eafbf40a960c020b8257f36b7e99fedb5dcf894

Observation 95789653-7df5-420e-a3fe-1b82bde2546f · outbound

This paper cites T., Zhang, Y., and Wang, M.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets T., Zhang, Y., and Wang, M

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.341288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.429657Z digest=sha256:b26af9c686c0cf2564b9d93b313cd63133c5d05fd649bd45ff8b6aaad49a9e46

Observation a6018676-ad8c-484c-aaa9-0ac424d8ea63 · outbound

This paper cites T., and Zhang, Y.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets T., and Zhang, Y

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.329363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.432919Z digest=sha256:058356a7d7316a7f2da859e0baf0697895fa4a3f76026d456ecd711f47464e3b

Observation 5e4fff59-0fa7-4b7a-9903-576cdf5403ed · outbound

This paper cites T., and Zhang, Y.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets T., and Zhang, Y

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.315625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.436469Z digest=sha256:0f72f07e58af376600d228f92d84ab189d7c8e619a578ec2469eafe9403bc71c

Observation 43cd4c80-b192-454f-8046-bc851f89d9f0 · outbound

This paper cites The llama 3 herd of models.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets The llama 3 herd of models

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.301025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.440527Z digest=sha256:b26ee121af3d3548d055e22d6da2d34dd202842526680b8eca755e5bd04793a0

Observation 720004a4-0041-4c7b-8616-21c82f81bc20 · outbound

This paper cites and Stork, D.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets and Stork, D

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.287671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.444165Z digest=sha256:77502af0cdad0410306f51959b6c8a87022235da1331a72d386f5b5a6e8720ea

Observation 7ba6578d-84b8-4c50-9955-cce397c50853 · outbound

This paper cites Measuring massive multitask language understanding.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Measuring massive multitask language understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.448267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.448267Z digest=sha256:a67cd103eada1c1202eba02d6ba2b7f7a8330da648cd759b6cac9400fdb38800

Observation d2ad24bc-93d6-47fc-b0a2-dddc0226617e · outbound

This paper cites Safe lo RA : The silver lining of reducing safety risks when finetuning large language models.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Safe lo RA : The silver lining of reducing safety risks when finetuning large language models

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.269461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.451877Z digest=sha256:c80d51a29cca65c46335edb051cfc89be1100caad1cfd1f82dba695c5a7a35d9

Observation d72c5881-5d81-4354-8c44-a7ef961ce7f0 · outbound

This paper cites J., Shen, Y., Wallis, P., Allen - Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets J., Shen, Y., Wallis, P., Allen - Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.456931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.456931Z digest=sha256:02a9396794e125769c48dc53b648fcb8e3a89caaba428db53d64f98010c48253

Observation 76a65fbe-7c41-4701-9911-e6b59e03fef1 · outbound

This paper cites Antidote: Post-fine-tuning safety alignment for large language models against harmful fine-tuning.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Antidote: Post-fine-tuning safety alignment for large language models against harmful fine-tuning

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.250159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.461037Z digest=sha256:f5d64f7ed6c7ef14daf0c2a88c13b43ab41f16a18f26142c21315e9acfe0e8ec

Observation 9b612919-b420-4318-b7e0-a888c7aa8687 · outbound

This paper cites F., and Liu, L.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets F., and Liu, L

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.238480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.465090Z digest=sha256:bfed86489049ceba0b0b31829f3f1d41a50dc052933bdb808ae62ed91a378288

Observation eafd6c8f-d5e5-4ab3-b7f8-2ee15ab700fe · outbound

This paper cites F., and Liu, L.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets F., and Liu, L

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.224298Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.468662Z digest=sha256:94f7fdb45d2b48c0b16f6aa2bbd4dc32568895023801a97e8149edadf68524f0

Observation 421020db-c577-4b03-a1a5-a29f28011a67 · outbound

This paper cites Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.211907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.471997Z digest=sha256:4d19dd8b55f6b9a1ab09aed9ec308ef32915159a5742dc107ad5ea9e50b61463

Observation d2f37b53-3550-42a9-afb8-42fd5393194d · outbound

This paper cites F., and Liu, L.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets F., and Liu, L

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.191379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.475759Z digest=sha256:2af6da7e403db69ae0bf5b7965e39df54920fa0fb53ea0a2980f819935e0c5e8

Observation 5cbf0e13-88cc-474e-ab1c-1ab6cdcd4e31 · outbound

This paper cites Catastrophic jailbreak of open-source llms via exploiting generation.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Catastrophic jailbreak of open-source llms via exploiting generation

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.175610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.479732Z digest=sha256:c4f3ef27fb93e2ff84e4e41d95b177280c6596e7bdb4addb527c5a2d71999d3d

Observation cab5168c-3bb7-448f-af79-b83b531848be · outbound

This paper cites Accurate post training quantization with small calibration sets.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Accurate post training quantization with small calibration sets

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.161514Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.483714Z digest=sha256:a715a1354b1d387a974d8e4b68da8603c69b3d42eb2f2764519a476d72887bfc

Observation 85ff3f11-f9ff-41bc-ac49-f9539ff67c26 · outbound

This paper cites Beavertails: Towards improved safety alignment of LLM via a human-preference dataset.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Beavertails: Towards improved safety alignment of LLM via a human-preference dataset

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.149895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.487369Z digest=sha256:a01bc96edbeeef8cfd21ebc9a4b79295c0c33cb554d72f03ccf22daf18412474

Observation 37b644d9-66d7-4628-8751-8769ea7c72f7 · outbound

This paper cites S., and Solla, S.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets S., and Solla, S

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.136499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.491331Z digest=sha256:b29cf5d861ab91143b7a03f97dfd7fb0672360a649ec2c7c31d638c64f49b09e

Observation c547a46f-67bd-4ed5-a71e-ed0338aa9c0b · outbound

This paper cites Rouge: A package for automatic evaluation of summaries.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Rouge: A package for automatic evaluation of summaries

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.494983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.494983Z digest=sha256:029a9ae01293274a6477a14c8d19da5efdfbd5ed2036a83ed78a665fd27766b2

Observation b2a75962-a90a-488e-b8fe-e3766bde06ed · outbound

This paper cites Efficient combinatorial optimization for word-level adversarial textual attack.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Efficient combinatorial optimization for word-level adversarial textual attack

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.112619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.499142Z digest=sha256:2dc8c43c348e9eb3ec549f5dcb82acff392a8bd45b39bce0e148bd22d87c3f6c

Observation cc8ff391-bddf-4cd1-84ac-f3792dc28994 · outbound

This paper cites Effective and imperceptible adversarial textual attack via multi-objectivization.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Effective and imperceptible adversarial textual attack via multi-objectivization

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.095666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.503233Z digest=sha256:7833315c2ca8fddffc99dc3cdeb744f6952d681bfb69f4a45f3a1f7dcc556958

Observation ff741e80-04be-4925-a69e-d9c7d707bc43 · outbound

This paper cites Autodan: Generating stealthy jailbreak prompts on aligned large language models.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Autodan: Generating stealthy jailbreak prompts on aligned large language models

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.081438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.508028Z digest=sha256:8090545533ae01d105680ecd8d62dc5f4299c65a8b7d511e69e46c1ba0aa6fa9

Observation 8a3fce4b-58c4-436d-944e-d3915437abf8 · outbound

This paper cites Jailbreaking chatgpt via prompt engineering: An empirical study.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Jailbreaking chatgpt via prompt engineering: An empirical study

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.069156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.511780Z digest=sha256:e0f193a8e8e1ab1b4057e2bb11e2971567935a20425f6497f5629ccda387e8b3

Observation 8ce2d8e3-a788-4de0-b3cf-19b558887bb9 · outbound

This paper cites and Hutter, F.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets and Hutter, F

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.515691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.515691Z digest=sha256:6e80eef3a4fe5524c3dd11d6d575dc858337dfacb99251f5dba2f961b23e7fff

Observation 1b48d144-5f21-43e5-a36d-da1e2fa5516c · outbound

This paper cites Large language models can be guided to evade ai-generated text detection.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Large language models can be guided to evade ai-generated text detection

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.048517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.519580Z digest=sha256:4e6632882ef06d937c222b126a13c93d4fadcb1e5078e45cecadb2416e1e17d6

Observation 12f0d60f-a0a8-4de2-8900-5d89404a427b · outbound

This paper cites Less is more: Understanding word-level textual adversarial attack via n-gram frequency descend.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Less is more: Understanding word-level textual adversarial attack via n-gram frequency descend

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.036850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.523814Z digest=sha256:76ebc7142eb94048699a72673528f438437f282f822bb653994af813e7c47698

Observation 086aa09e-52d0-428c-9a82-d9f5c532ad10 · outbound

This paper cites Training overhead ratio: A practical reliability metric for large language model training systems.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Training overhead ratio: A practical reliability metric for large language model training systems

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:10.024008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.527712Z digest=sha256:7fa9624b7f29a2c530b5c34f27e9bd329ebf62ad28448c34d166ec3fafa3340a

Observation 5c5d159b-7570-46a2-934a-4c80b0ceaf2b · outbound

This paper cites an unresolved cited work.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:48:10.009449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.531460Z digest=sha256:111fc4fde12847890e219c16a2d422da29e1baf0960962724794748bd88a8eca

Observation baa0e1a6-2158-4c23-be02-da1a495353e6 · outbound

This paper cites Training language models to follow instructions with human feedback.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Training language models to follow instructions with human feedback

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.534885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.534885Z digest=sha256:fb5cc2bb8d23693a9e0cbf832202ad9cf51819ec310f0b0d40155d1931b7f1fe

Observation 89f38a6a-2757-427a-ac4d-a5f79d4df568 · outbound

This paper cites Fine-tuning now available for gpt-4o, 2024.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Fine-tuning now available for gpt-4o, 2024

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.989266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.538573Z digest=sha256:2127b89038a3c9e3d7040148b185e30dfe1ea2e41b0f6a8be0a57ca31769caa9

Observation c5cc1688-fbb6-4376-9516-d02af1e946e6 · outbound

This paper cites Instruction tuning with GPT-4.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Instruction tuning with GPT-4

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.979184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.542032Z digest=sha256:07ca3f95d53a07578f948ea12f761f4b54a3d268af1f89c3a55c12255320c44a

Observation 3409dd57-7632-4bc2-a924-08eab1087789 · outbound

This paper cites Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations, 2024.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations, 2024

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.968712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.545866Z digest=sha256:fbe0ded16e99fd1e1fea2862b1cea19ef6475cead79eb9aa1982f9167b49d90f

Observation 1f14dfad-4f74-48a4-85cf-db3325442932 · outbound

This paper cites D., Ermon, S., and Finn, C.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets D., Ermon, S., and Finn, C

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.955652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.549437Z digest=sha256:a52a5a53af9bb2a3f2348f4ed190e9ae257ae4007c5d8d80395fbb173f2ae399

Observation 3eff96cc-2f75-460d-a807-f4aff180614e · outbound

This paper cites Modelgrow: Continual text-to-video pre-training with model expansion and language understanding enhancement.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Modelgrow: Continual text-to-video pre-training with model expansion and language understanding enhancement

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.942964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.553069Z digest=sha256:2818a0e0e5376f83b05037aa7a62602eb8d450fa61ade675231ecaab6cda1405

Observation 50cf077a-867a-4fe9-96a3-029a9f7074d3 · outbound

This paper cites Representation noising: A defence mechanism against harmful finetuning.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Representation noising: A defence mechanism against harmful finetuning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.929236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.556856Z digest=sha256:829e529266a839380ef3411ad85e731cf655abf92a2e2041a8177cdab0a40dd1

Observation febc9c75-3f5d-47de-803c-9ce89aac5cfb · outbound

This paper cites an unresolved cited work.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:48:09.916189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.560333Z digest=sha256:86a9691d68f12130f63b219f91533f6d19911ac4436623db2b3da9fd477f8d1f

Observation 9c59bfa1-d2d5-4804-8972-aa168d140938 · outbound

This paper cites do anything now.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets do anything now

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.903027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.563765Z digest=sha256:a990fa98f400ad91864139dd55da8e08c844b5a3064b51d89e12d66f3098c553

Observation b8406427-e273-49eb-b614-0c6f8059cd1e · outbound

This paper cites Axiomatic attribution for deep networks.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Axiomatic attribution for deep networks

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.889922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.567295Z digest=sha256:383c1d24962d58a885d2de97cf290a062de2b8249cb572c58d23f39455ff098d

Observation 91529f78-8d93-485c-9738-0e1c54cd2af4 · outbound

This paper cites Intriguing properties of neural networks.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Intriguing properties of neural networks

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.570773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.570773Z digest=sha256:6b6fd6f335f5e38fa18f4274b70a17e5f63b1365acef4dea198c5af772c6cf12

Observation a816b57d-fada-4e37-aa60-da5529643cde · outbound

This paper cites an unresolved cited work.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Unresolved cited work

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.574479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.574479Z digest=sha256:91e924417fdc93fd87e58060c4b1d016bbd65f6e16ccede6f94d3d46f87a0efb

Observation 8cfe80fa-a50d-485d-af6d-e2df5fa984af · outbound

This paper cites Llama 2: Open foundation and fine-tuned chat models.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Llama 2: Open foundation and fine-tuned chat models

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.870472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.577567Z digest=sha256:f184ad495692d1f4a07261c4597003254279403a240ee3873f3f308492d6e1f4

Observation 5469cc26-d445-4d2f-afe1-f8c12451fa4d · outbound

This paper cites Backdooralign: Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Backdooralign: Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.858553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.580553Z digest=sha256:e0961d9d63ab7689e6e5857f376795d0322f3af69d0131ce00d381b747c2af59

Observation 4bbcd51a-bee2-4bd9-86d6-e7f46c1013ad · outbound

This paper cites W., Lester, B., Du, N., Dai, A.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets W., Lester, B., Du, N., Dai, A

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:09.584046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:48:09.584046Z digest=sha256:1ae4f1c5119adbf97bc8afbaed8d8d5f484e8b5aa7aeb4423a9ca41e294a888a

Observation 34a1d094-073c-4a9d-947a-7c08c09d0c42 · outbound

This paper cites an unresolved cited work.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Unresolved cited work

Reference 61

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:48:09.840610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.587511Z digest=sha256:2fe632ad07fc920a13d3b25ee446014f9b6d99f8e88ec6ebaccb8c61967e7d66

Observation ca1bf601-9710-4d28-a6e5-d615025475f9 · outbound

This paper cites T., and Zhang, Y.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets T., and Zhang, Y

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.828375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.591061Z digest=sha256:424922d9880276c1cbe2c53ce184559c381e15db61db2c4122e7c3dbfbfb7d88

Observation e111a9b0-e93e-441d-9842-e85a989af69c · outbound

This paper cites Open the eyes of mpnn: Vision enhances mpnn in link prediction, 2025.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Open the eyes of mpnn: Vision enhances mpnn in link prediction, 2025

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.816424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.594549Z digest=sha256:9d932e821ee7d72e405941c75282022074e79ec0e3309d3edc2d50bceb659f5f

Observation 4352e134-1c60-455a-b689-5b751316a200 · outbound

This paper cites Backdoor graph condensation.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Backdoor graph condensation

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.804801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.598759Z digest=sha256:f259df3db147d56bd0d4a39ef8d8e78d6f9988cf6390a6c0561526ab2a247255

Observation f0d71694-5392-408c-9660-75b5f1c6470b · outbound

This paper cites Tf-dcon: Leveraging large language models (llms) to empower training-free dataset condensation for content-based recommendation, 2025.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Tf-dcon: Leveraging large language models (llms) to empower training-free dataset condensation for content-based recommendation, 2025

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.790900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.604127Z digest=sha256:839c691997934f42274106e0d0abbe3e550512d0f88e3b31f6dff3bb7033833a

Observation 00bc88b6-1acf-4493-aa6b-e2118a33cd38 · outbound

This paper cites RLCD: reinforcement learning from contrastive distillation for LM alignment.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets RLCD: reinforcement learning from contrastive distillation for LM alignment

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.778858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.608118Z digest=sha256:de2c3e9615d4e263e01ec09e31a4ecb67c7d04d694aee59c4b17765e5dc10c55

Observation 1bc3c7b1-5acf-445b-969f-027fc208a9e9 · outbound

This paper cites Y., Zhao, X., and Lin, D.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Y., Zhao, X., and Lin, D

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.765742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.612215Z digest=sha256:6b18985ef44ab5b060b08ba3896006d7ea54592f5a22c277e8a155d3e43f6814

Observation e73d58be-004b-41e2-8c42-1806d6eac4fb · outbound

This paper cites NLSR: neuron-level safety realignment of large language models against harmful fine-tuning.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets NLSR: neuron-level safety realignment of large language models against harmful fine-tuning

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.755306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.616258Z digest=sha256:7d183145a78360890d0f2e31ebf1d5d6981add6119aa87210a4cb11e7962f2ba

Observation 7e91603c-a9ac-456e-83f9-cd977e6019ac · outbound

This paper cites an unresolved cited work.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Unresolved cited work

Reference 69

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:48:09.744809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.620062Z digest=sha256:a5b769c3e59160834477b4d37e3bea89641f06d91c3caba15806e51127d9b1f7

Observation c731b779-da08-4469-8551-bb95f636ea28 · outbound

This paper cites GPT-4 is too smart to be safe: Stealthy chat with llms via cipher.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets GPT-4 is too smart to be safe: Stealthy chat with llms via cipher

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.733690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.623682Z digest=sha256:83ee827d5be9956faf900e07e64963e195c22281d60fe80fe103c1a349b9855d

Observation 86e8a6a8-443d-4d40-beb8-24f16c2d4e51 · outbound

This paper cites Removing RLHF protections in GPT-4 via fine-tuning.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Removing RLHF protections in GPT-4 via fine-tuning

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.722035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.627432Z digest=sha256:20d27690e764b50d2ef749b35d0d7eed03d8fcb8abc7d7bbdc1661087183c5af

Observation 648c4e5a-e75e-4bf7-82f3-634c0cf6e84d · outbound

This paper cites P., Zhang, H., Gonzalez, J.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets P., Zhang, H., Gonzalez, J

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.709539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.630723Z digest=sha256:53639cd7637d2d34871bd50fe097fc6c965534aa6a88026975091b6fd2195084

Observation 70f4184b-93f8-4cff-b3e4-157072b49626 · outbound

This paper cites Model tailor: Mitigating catastrophic forgetting in multi-modal large language models.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Model tailor: Mitigating catastrophic forgetting in multi-modal large language models

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.696452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.633974Z digest=sha256:6f2f103dd61458485d29f344526cba92e712aa2e9e1e8712f0d7aff226d0a963

Observation e0e6b709-8b36-48fe-a6fc-0777aea92182 · outbound

This paper cites Z., and Fredrikson, M.

Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Z., and Fredrikson, M

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:48:09.683985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:48:09.637499Z digest=sha256:0069ec0fe0e89274a0703f7fa5f15269f659e9a456dffd665fac4970ce5c95f6

Pith citing papers

Observation 9df8334b-e98c-4196-b3b4-0d0ce55f9688 · inbound

Open Your Eyes: Vision Enhances Message Passing Neural Networks in Link Prediction cites this paper.

Open Your Eyes: Vision Enhances Message Passing Neural Networks in Link Prediction Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T22:05:50.798330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T22:05:50.798330Z digest=sha256:f3187363d0c2297b82c99a2a154fe0afbc8c2157da195ac2fa7dcadd0af1ddc9

Observation aa548b6b-122a-4a6b-80d2-7e615c384983 · inbound

Continual Safety Alignment via Gradient-Based Sample Selection cites this paper.

Continual Safety Alignment via Gradient-Based Sample Selection Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:16:54.726087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-10T07:16:53.472918Z digest=sha256:c3a1df243bb5fbad8ff963257f19ce85683c694dd2e187932a9cbfc4d83c2931

Observation 1ad72020-6449-47aa-a97c-2bb7e0eae2e0 · inbound

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment cites this paper.

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T10:00:09.737616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T10:00:09.737616Z digest=sha256:0f69a6c9a017926786fbe2c4a442994ec992fe56c960d6b8f29e073b4d372bef