{"as_of":"2026-08-13T04:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b9fc5ad3f4d84baf06abdf846f23a74f77e9f0b4689569d0c44e3f75fb8bc79","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:06:48.229957Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.12497/citation-record","integrity":"/paper/2412.12497/integrity","json":"/paper/2412.12497/citation-record.json","paper":"/paper/2412.12497"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.058083Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.058083Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:2b5289614c2e4bd12f94545828c9fe900849345caa762d0ed4ba12ab6e8641ee","observation_id":"40854e01-e74b-4965-b0d9-cbe40d469c66","resolution":{"observed_at":"2026-08-11T14:06:48.058083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.063975Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.063975Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:f8fde050711e7438b0694d5933cb0adae60b0933d63c2451d3b68f823e861fb1","observation_id":"f62d56ff-3c3c-462a-a48d-5c6e327e6c3f","resolution":{"observed_at":"2026-08-11T14:06:48.063975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11746","last_updated":"2024-02-19T00:18:09Z","snapshot_observed_at":"2026-08-12T14:51:24.253965Z","submitted_at":"2024-02-19T00:18:09Z","title":"Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11746","snapshot_observed_at":"2026-08-11T14:06:48.069054Z","title":"D.; and Poria, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.069054Z"},"links":{"cited_paper":"/paper/2402.11746","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:70a9567714e8fd1a6846cb9f003ce719743c3ad3a0580af901bddd41332d161c","observation_id":"97e7f11b-9295-469f-b56e-e7c105f557f3","resolution":{"observed_at":"2026-08-11T14:06:48.069054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.075163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.075163Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:896642c8261fe2d98fc4ccb8e6d255747726608d46adc13918e048f1203f1937","observation_id":"8fe5e615-492f-4fec-9fef-51ca9752eaf5","resolution":{"observed_at":"2026-08-11T14:06:48.075163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.791744Z","title":"F.; Leike, J.; Brown, T.; Martic, M.; Legg, S.; and Amodei, D","venue":null,"work_id":"809ea385-a7b2-4640-83f5-d73b4d9b7349","year":2017},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.079786Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:737257b14ac40329bdc6b79e1774544dd78d0ebbb0afbe141cb12724b5bda1b8","observation_id":"b08d789a-be3f-417c-8a36-623d179d9365","resolution":{"observed_at":"2026-08-11T14:06:48.796303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T14:06:48.084434Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.084434Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:8ccde6c733372b172649020a421a4092655a5916e8d095cf320e1de5cf66eec8","observation_id":"d9decf9f-77b8-401e-97d0-1fa8f5e22ec8","resolution":{"observed_at":"2026-08-11T14:06:48.084434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.089407Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.089407Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:d34d4a52ae0ab5b0697265d0a599e5c1a6b7bfa0ec1aab70a0c078c8493d8283","observation_id":"6bfafd4c-6f98-4d53-b514-05e918f83dad","resolution":{"observed_at":"2026-08-11T14:06:48.089407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11617","last_updated":"2024-06-17T15:02:45Z","snapshot_observed_at":"2026-08-12T23:41:00.562420Z","submitted_at":"2024-06-17T15:02:45Z","title":"DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11617","snapshot_observed_at":"2026-08-11T14:06:48.093168Z","title":"T.; Bhardwaj, R.; and Poria, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.093168Z"},"links":{"cited_paper":"/paper/2406.11617","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:d15c19215732ce44533b4cd1607e925daebeedcee1d969e14287e696a37b26d9","observation_id":"a64e96ea-2383-4421-981b-1f5701fa8642","resolution":{"observed_at":"2026-08-11T14:06:48.093168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-11T14:06:48.097418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.097418Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:db954f0f5bbfe8debe7e7baf645be5c87af9c3c738679833d48d99a464c97ea4","observation_id":"dc1f3363-4a3d-41a8-bc03-4280d3fc4d82","resolution":{"observed_at":"2026-08-11T14:06:48.097418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.773367Z","title":null,"venue":null,"work_id":"52998a41-aae3-4937-9939-f5279e409e92","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.101760Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:29ae15e92c4a39cafb4a8bf0d8980f4acdea939d70fbbd6f23336c00968fa0cb","observation_id":"0239bebb-fd78-40f0-bc2f-39878c464e92","resolution":{"observed_at":"2026-08-11T14:06:48.776979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-11T14:06:48.105864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.105864Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:8d90859067e046d6241bc6f16c32b4791edeeb4685fff3068ca3b8aa0ce8676c","observation_id":"03b1b44d-4afc-4701-97e0-e3ea5d04b89e","resolution":{"observed_at":"2026-08-11T14:06:48.105864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16833","last_updated":"2025-01-05T21:51:46Z","snapshot_observed_at":"2026-08-12T23:57:29.577191Z","submitted_at":"2024-05-27T05:04:05Z","title":"Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16833","snapshot_observed_at":"2026-08-11T14:06:48.111897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.111897Z"},"links":{"cited_paper":"/paper/2405.16833","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:e20605b7aac530e2d39f92c8519e28b28cc8f93bbdbc4a80fcdb84df6cf2119b","observation_id":"60247d1a-0e15-4410-b08e-c23a53876c12","resolution":{"observed_at":"2026-08-11T14:06:48.111897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.761304Z","title":"J.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; Chen, W.; et al","venue":null,"work_id":"60754ed3-c5c5-4c3c-b37a-2933d0a1ce97","year":2022},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.116771Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:7ca8b6a154beadaebbf9c5b1d08a971c88609606a19cee52ba8e220f7e116af3","observation_id":"3be4e412-dd8a-4cac-a863-aa41b3c84101","resolution":{"observed_at":"2026-08-11T14:06:48.765676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09600","last_updated":"2025-09-05T04:54:29Z","snapshot_observed_at":"2026-08-12T23:01:49.086216Z","submitted_at":"2024-08-18T21:45:03Z","title":"Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09600","snapshot_observed_at":"2026-08-11T14:06:48.121324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.121324Z"},"links":{"cited_paper":"/paper/2408.09600","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:070a3aa68bfa27da36905c834c3613b26dfa233122ce94805f750042bee5a0b9","observation_id":"1cf6fbb8-cf1c-47f2-a878-01a11a2c7bb9","resolution":{"observed_at":"2026-08-11T14:06:48.121324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.748147Z","title":"F.; and Liu, L","venue":null,"work_id":"955871f9-dc5a-43dd-9ce6-20bd3ec2f94b","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.125788Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:4be1fe4503af3aa079ae2a3ab8f469e950db11a2956b0070d8c009a62ade00af","observation_id":"690d51f3-c27d-461a-8c21-3a61329e228b","resolution":{"observed_at":"2026-08-11T14:06:48.752758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18641","last_updated":"2024-10-29T05:46:55Z","snapshot_observed_at":"2026-08-12T23:55:40.111981Z","submitted_at":"2024-05-28T22:53:43Z","title":"Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18641","snapshot_observed_at":"2026-08-11T14:06:48.130126Z","title":"F.; and Liu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.130126Z"},"links":{"cited_paper":"/paper/2405.18641","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:5cda7f3bf48eb1dae3aede985b20f4fc46beafd446c7da95e8e376b812d5ab9e","observation_id":"dbf4849b-520d-4b25-9590-fac183c3c6eb","resolution":{"observed_at":"2026-08-11T14:06:48.130126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01109","last_updated":"2024-11-24T20:09:55Z","snapshot_observed_at":"2026-08-10T01:00:48.523678Z","submitted_at":"2024-02-02T02:56:50Z","title":"Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01109","snapshot_observed_at":"2026-08-11T14:06:48.134674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.134674Z"},"links":{"cited_paper":"/paper/2402.01109","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:296ceb6c9306a5c84d792ec945fcc6ace8e9f6573ee0fa70939b685d1112b85f","observation_id":"6365235b-d91b-493e-a612-5f4efede6104","resolution":{"observed_at":"2026-08-11T14:06:48.134674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.140584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.140584Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:72a26de67683594b70cabe859ffd4c1185ac60607954e0990631c64c21bd68f5","observation_id":"6bba3c2a-6f66-454b-a60c-6cccafaaa134","resolution":{"observed_at":"2026-08-11T14:06:48.140584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04392","last_updated":"2024-09-09T06:25:33Z","snapshot_observed_at":"2026-08-13T01:20:14.624395Z","submitted_at":"2024-04-05T20:31:45Z","title":"Fine-Tuning, Quantization, and LLMs: Navigating Unintended Outcomes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04392","snapshot_observed_at":"2026-08-11T14:06:48.144977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.144977Z"},"links":{"cited_paper":"/paper/2404.04392","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:f94d2c5e11c326e6fc5ef75ecc6a0c68a44f4b5193a70370c6fb61ca31c2241a","observation_id":"34ddb55e-4d52-4603-a3ab-5c1c2d3b468e","resolution":{"observed_at":"2026-08-11T14:06:48.144977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.728904Z","title":null,"venue":null,"work_id":"1e13a55c-b7ff-4b21-97b1-d45fcbb5419c","year":2018},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.150529Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:9932651f50aebc9ee3e2fa37d0153f357e968443bd6fcf5bf8aafba311454fe8","observation_id":"37dba6a7-9873-44ef-8f81-ea53b7fdb5a3","resolution":{"observed_at":"2026-08-11T14:06:48.733378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T14:06:48.154835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.154835Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:c8cf29375905fe95f06e7b830befab3717bf485b63646a60e3859d20d7e90105","observation_id":"3ada8865-7075-4e2d-ac37-d98dea9d8925","resolution":{"observed_at":"2026-08-11T14:06:48.154835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.716072Z","title":null,"venue":null,"work_id":"86bc1d72-9f9a-48cd-9f90-22e04261fec5","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.159390Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:24b4543713a9998549e286133eee4936a2ba0938f44f23b3b76610c9a8fa361d","observation_id":"11ee58a7-7eda-4938-b8ba-fe15bee946e9","resolution":{"observed_at":"2026-08-11T14:06:48.720242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.163494Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.163494Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:85add62752319cecbdee0ece0357266fd907f8e91c8718819e33e16554152a97","observation_id":"07953f59-80f5-44a2-ae5d-c74f2578d8fc","resolution":{"observed_at":"2026-08-11T14:06:48.163494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.693438Z","title":"M.; Weber, L.; Choshen, L.; Sun, Y.; Xu, G.; and Yurochkin, M","venue":null,"work_id":"ea168f76-5e54-4235-865a-5986e6a44c1e","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.168044Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:5749602169c9a2db3ae2e866abc272137abbf8f189a021ecd842bbb05a02b061","observation_id":"d8a70c95-2273-4ece-b0bd-5ff11ef1c5f0","resolution":{"observed_at":"2026-08-11T14:06:48.699002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-12T23:46:49.092229Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-11T14:06:48.172421Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.172421Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:52da860e6d08c7ee62ca3e7a92cd0cb0ee25e38a7c7ac6074a80237fc739e764","observation_id":"23553a85-712b-41ce-81f0-b4d386c4eac7","resolution":{"observed_at":"2026-08-11T14:06:48.172421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13459","last_updated":"2025-05-29T14:42:38Z","snapshot_observed_at":"2026-08-04T11:15:46.100317Z","submitted_at":"2024-02-21T01:30:03Z","title":"Learning to Poison Large Language Models for Downstream Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13459","snapshot_observed_at":"2026-08-11T14:06:48.176729Z","title":"Z.; Roshani, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.176729Z"},"links":{"cited_paper":"/paper/2402.13459","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:ca1d3e5a4cb2272ad6b106487d3e8eb85a73559dfdb150a35861f5c9abb0d61c","observation_id":"bebc58f5-0fab-40a1-a6c5-74861db3b877","resolution":{"observed_at":"2026-08-11T14:06:48.176729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.180673Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.180673Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:e144cbe4a699e537985db1bc3eeec883704a4b04b96d89fcd2de12ec14f85d6f","observation_id":"e48056dc-b2cb-4cd1-aff1-81eae5d6b4b0","resolution":{"observed_at":"2026-08-11T14:06:48.180673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14981","last_updated":"2025-04-16T09:38:09Z","snapshot_observed_at":"2026-08-12T23:18:00.277636Z","submitted_at":"2024-07-20T21:13:56Z","title":"Open Problems in Technical AI Governance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14981","snapshot_observed_at":"2026-08-11T14:06:48.185516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.185516Z"},"links":{"cited_paper":"/paper/2407.14981","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:f85743ada3dc075b1f33c9fb9d16995e185ccdc47b05a7f5bc436f091121836a","observation_id":"91be9f52-0582-4a44-8897-72b6035d46a0","resolution":{"observed_at":"2026-08-11T14:06:48.185516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.659460Z","title":null,"venue":null,"work_id":"2b58817e-f427-4c46-a633-d8ce8b797baf","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.190088Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:80ef794be1a01c950a81dc979d4901c7cef509814a6979bf9cc942fdba7932a4","observation_id":"5884aaed-a0e4-4cae-a4f4-211157209f5e","resolution":{"observed_at":"2026-08-11T14:06:48.665244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.643295Z","title":null,"venue":null,"work_id":"a0990538-ab93-439a-b7d2-ddf032320ab0","year":2023},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.193565Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:11982e354f638391a7d348d04ddc0f06573cb40ed48d6002ac1d39929674fd56","observation_id":"155607c6-7134-4392-92ef-3e3f3826709b","resolution":{"observed_at":"2026-08-11T14:06:48.648895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.197255Z","title":"D.; Ng, A","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.197255Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:20a56ecbbf90cd572caff3506cd1f2189b63d1aba20674fa2f2a4216c593b2da","observation_id":"73d38436-1141-4c7c-9139-04a1373b2d4e","resolution":{"observed_at":"2026-08-11T14:06:48.197255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.622703Z","title":null,"venue":null,"work_id":"af67be99-e74a-4eeb-bdb1-3f36e136766c","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.201967Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:db566340f4123ef08e37d447967ed3c815d1d72b18231b58ce76bd1d095f3552","observation_id":"1ae85030-7255-4309-8c58-a4856bb3fc38","resolution":{"observed_at":"2026-08-11T14:06:48.627338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.610494Z","title":null,"venue":null,"work_id":"1e6acc58-6f19-4654-9f2f-9de57b07b638","year":2023},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.205663Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:bc51f9ada97bc12a776839260832ac25841f2366ed87aa3194fe14c80453e56b","observation_id":"b0e13af2-798e-439e-bfad-f2e1609a6e33","resolution":{"observed_at":"2026-08-11T14:06:48.614745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.597532Z","title":null,"venue":null,"work_id":"69970236-23ae-4c80-a9f4-0605fe2fce70","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.209198Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:dcbfb3d5db5a4445c7ca37fb4e0c8ee2cc6f7eb3352f8cbafd3be097e87be96a","observation_id":"cdbd60c0-94a6-4a42-a7d2-75353dabf277","resolution":{"observed_at":"2026-08-11T14:06:48.601700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-07T11:20:01.991656Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-11T14:06:48.213034Z","title":"Y.; Zhao, X.; and Lin, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.213034Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:90de5bfa2835e7a96b2867c67364b4decfee2f2718edc39bba1ead53eadf80d1","observation_id":"5c404844-43ab-4d8a-8466-32a1ffca7b90","resolution":{"observed_at":"2026-08-11T14:06:48.213034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17092","last_updated":"2024-06-24T19:29:47Z","snapshot_observed_at":"2026-08-12T23:35:46.419773Z","submitted_at":"2024-06-24T19:29:47Z","title":"BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17092","snapshot_observed_at":"2026-08-11T14:06:48.217261Z","title":"N.; Song, D.; Li, B.; and Jia, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.217261Z"},"links":{"cited_paper":"/paper/2406.17092","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:dd0f4c6063d02af8994cc02deba47ab440103591ce25f7b0e3279d918731c5e9","observation_id":"85bc9187-ca80-4bed-aeaa-c403d0630379","resolution":{"observed_at":"2026-08-11T14:06:48.217261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.221300Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.221300Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:2b34dbf0c785f3ca12257c38da19b9b91f7af380aa36a02dff04d430d9594516","observation_id":"8cc23ba2-e465-4ddf-a77b-9681f0fa6f87","resolution":{"observed_at":"2026-08-11T14:06:48.221300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16792","last_updated":"2025-05-30T04:58:07Z","snapshot_observed_at":"2026-08-13T00:22:04.515541Z","submitted_at":"2024-04-25T17:39:50Z","title":"Model Extrapolation Expedites Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16792","snapshot_observed_at":"2026-08-11T14:06:48.225243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.225243Z"},"links":{"cited_paper":"/paper/2404.16792","citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:d0f35431e880c3e0305fc9a8db3c97925740aa81dd8b78566b94bb5e74391cac","observation_id":"cbd7fd4a-5d4f-467b-9214-c6580f013d38","resolution":{"observed_at":"2026-08-11T14:06:48.225243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:48.572755Z","title":null,"venue":null,"work_id":"89ed326f-9783-4b8d-a55b-f0a2c2842224","year":2024},"citing_paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:06:48.229957Z"},"links":{"citing_paper":"/paper/2412.12497"},"observation_digest":"sha256:70ea64a3b634b59c40940b1a0c4f5dc16de0c6f88c413d5b7da528a6d056ef9b","observation_id":"ddb25a55-3154-46aa-a0c3-959550278c99","resolution":{"observed_at":"2026-08-11T14:06:48.577859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12497","last_updated":"2024-12-17T02:59:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T20:11:55.085742Z","submitted_at":"2024-12-17T02:59:04Z","title":"NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2412.12497."}