{"as_of":"2026-08-10T06:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab592198d52ddbe8616a15ffa4228885bd99c2ddbd42b5dc49f4c91f139f1a4a","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T17:37:39.675692Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:00:19.630547Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T23:10:21.867778Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00840","snapshot_observed_at":"2026-08-06T23:00:19.630547Z","title":"Activation approxima- tions can incur safety vulnerabilities even in aligned llms: Comprehensive analysis and defense.arXiv preprint arXiv:2502.00840,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20251","last_updated":"2025-06-25T08:52:22Z","snapshot_observed_at":"2026-08-07T22:24:27.303298Z","submitted_at":"2025-06-25T08:52:22Z","title":"Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:19.630547Z"},"links":{"cited_paper":"/paper/2502.00840","citing_paper":"/paper/2506.20251"},"observation_digest":"sha256:c9936733e51cc997a2a89926d0228f0431b5b6fceb88f4e54edc02f444e4b807","observation_id":"80a66c5d-3841-47f2-9391-cd8c2d36cf8c","resolution":{"observed_at":"2026-08-06T23:00:19.630547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"cited_work":{"arxiv_id":"2502.00840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00840","snapshot_observed_at":"2026-08-04T23:10:21.867778Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","venue":"cs.CR","work_id":"df0d9649-d11a-4f60-a64f-edbe19f43750","year":2025},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-06T11:18:33.345942Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.257150Z"},"links":{"cited_paper":"/paper/2502.00840","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:52a4f2a8ead7f0ec1e7c67cb19425b3856064479a22aae0b6a33d85c49144d6f","observation_id":"4c9d6148-5e6c-4d0a-b445-f368849463d7","resolution":{"observed_at":"2026-08-04T23:10:21.874478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00840/citation-record","integrity":"/paper/2502.00840/integrity","json":"/paper/2502.00840/citation-record.json","paper":"/paper/2502.00840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.445405Z","title":"Chat generative pre-trained transformer (chat- gpt)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.445405Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:e5243d98f7fa59e1c847245deb310fd00ce633fed83dbd3fe68ef9dd39c9b01b","observation_id":"e2140333-e41d-4262-babf-344189700f7e","resolution":{"observed_at":"2026-08-09T17:37:39.445405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T17:37:39.449262Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.449262Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:881e7fdd614202b6a88ad95e35b697a4aaa42247f77a3eb207c936f50449fd1a","observation_id":"0cea145c-5b3c-45de-a31e-bd36475a504c","resolution":{"observed_at":"2026-08-09T17:37:39.449262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-09T17:37:39.452541Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.452541Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:7451af118783cdba72cd9cd056a391d19e4e8c3adb726f867dacf84dcd50f29b","observation_id":"5ba827a8-8fac-4239-962e-599a67040617","resolution":{"observed_at":"2026-08-09T17:37:39.452541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T17:37:39.455573Z","title":"Mistral 7b.arXiv preprint arXiv:2310.06825, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.455573Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:7f178b368d51adb0c426afb207ed5443594c4ec74d1d4bb9bfdee1dd954b253d","observation_id":"74610e66-12fc-4343-8437-0fcfe916ef52","resolution":{"observed_at":"2026-08-09T17:37:39.455573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-09T17:37:39.458365Z","title":"The falcon series of open language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.458365Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:528d8585d0617eca012abeff88dc0f2a63da3dec12bc5315df6dc1a4b672e0d0","observation_id":"01e4ab5a-08e7-4396-9012-3dfd8245a74f","resolution":{"observed_at":"2026-08-09T17:37:39.458365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T17:37:39.461305Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.461305Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:0a832d5d6e0ef8a4f4b9edc09d5f61ca81cea4c11a2528e3ffd98ce957849e42","observation_id":"64401fd9-c23c-4d59-aa32-5ca14ea0d8f3","resolution":{"observed_at":"2026-08-09T17:37:39.461305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-09T17:37:39.464411Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.464411Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:b2beed4d19c07a484c675318ea249728c280d409dc5b6116d5d6e285cc94e73b","observation_id":"d0ec0fee-50b6-4ebe-92af-222ca99d8f52","resolution":{"observed_at":"2026-08-09T17:37:39.464411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.467467Z","title":"Sigmoid- weighted linear units for neural network function ap- proximation in reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.467467Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4340361b56a69ae38d1cc460b043613bbbad610f39ba062c19eb8fcb790389d6","observation_id":"c704735d-6f10-4dcb-b2a8-67c736845040","resolution":{"observed_at":"2026-08-09T17:37:39.467467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.470224Z","title":"Awq: Activation- aware weight quantization for on-device llm compres- sion and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.470224Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:3b002a74452c27231a402386114c7aad78ded4d2b8620329e4b5c648a1902b53","observation_id":"a6aaae0c-d6cd-4a15-bb84-41a7bbc6a0cb","resolution":{"observed_at":"2026-08-09T17:37:39.470224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.472818Z","title":"GPTQ: Accurate post-training compression for generative pretrained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.472818Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:04ca2a59a2babf1f58affb51d9623aadc0d4fab2799b40933991f1b9b65b3bab","observation_id":"35836eb3-c6d7-437f-8d81-84cfea072082","resolution":{"observed_at":"2026-08-09T17:37:39.472818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.475289Z","title":"Billm: Pushing the limit of post-training quan- tization for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.475289Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:62625d079c754ffd2014d22178254cc4e83e9f30d47fd59ef25a1e8bdd39a63e","observation_id":"479f9a15-8326-4792-8bfd-ec4a0f8371c4","resolution":{"observed_at":"2026-08-09T17:37:39.475289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.477774Z","title":"Sparsegpt: Massive lan- guage models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.477774Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:b9575e985c4610d0ef3f099576c1f660258af5e77be1d6f280b26dceeb05296f","observation_id":"651d0dfb-4ab2-45ee-9c83-d4503e1b4c98","resolution":{"observed_at":"2026-08-09T17:37:39.477774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.480322Z","title":"Llm- pruner: On the structural pruning of large language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.480322Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:86c016ce2ae8c5f2973db7e3d2a8d4fffc2aa5c2e6605e0692b2d5d696460bb6","observation_id":"2bbb1169-9b05-45db-bc95-7c1ca97e02af","resolution":{"observed_at":"2026-08-09T17:37:39.480322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-09T17:37:39.482768Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.482768Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:83b52f571e5a55644c7e88a3e08b685d0437b58eb0cfe41cb959407dc5b4e57a","observation_id":"d7a430ef-fed4-41b6-b1ba-6de630ba7c3e","resolution":{"observed_at":"2026-08-09T17:37:39.482768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04732","last_updated":"2021-03-28T19:04:25Z","snapshot_observed_at":"2026-08-06T01:26:31.344805Z","submitted_at":"2019-10-10T17:44:18Z","title":"Structured Pruning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04732","snapshot_observed_at":"2026-08-09T17:37:39.485481Z","title":"Struc- tured pruning of large language models","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.485481Z"},"links":{"cited_paper":"/paper/1910.04732","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:fd4f42b3c06bbdcba37a1a278c41b014730ce3d8bbb2f4cc02ab78fe5a63ef85","observation_id":"faed12e6-880d-4a75-9f5a-8bbbb02903de","resolution":{"observed_at":"2026-08-09T17:37:39.485481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.488230Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.488230Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:a473a6947aa0a2f8806f3c440a991266d22aa244bc2f73be1209d237077a73d3","observation_id":"058c99be-1b39-4bf5-9a2b-a218ac461f99","resolution":{"observed_at":"2026-08-09T17:37:39.488230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.490567Z","title":"Speculative decoding with big little de- coder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.490567Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:164a49e1cadf1dca3d98bd2e4da8649544a876e02eee7a680b1d8c07f87ce31e","observation_id":"68d3aff6-70f9-42cc-b2b5-c48b44aca84b","resolution":{"observed_at":"2026-08-09T17:37:39.490567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.492867Z","title":"Iron: Private infer- ence on transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.492867Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:772f23bef53d4be8ef2617c210c3d9b1a7923d66ca9ff0e57c4d7a4829a46809","observation_id":"bdda5e25-d4fe-4fb3-92b7-8fe140a74b12","resolution":{"observed_at":"2026-08-09T17:37:39.492867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.494884Z","title":"Ciphergpt: Secure two- party gpt inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.494884Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:63dde64dd9e8f699e9f110d80610f7ca2085bbd1cef6a6aef850a8e57ea9c9a4","observation_id":"a5dafbbe-a6ca-40c3-a41c-8fb73b586f97","resolution":{"observed_at":"2026-08-09T17:37:39.494884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.496815Z","title":"Bolt: Privacy-preserving, accu- rate and efficient inference for transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.496815Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:c5d5be78d77478d4356b2cbf7ca100b647b810c9cea98b6abdee0e11466a69ee","observation_id":"be552ba8-a521-4ba9-9f1b-57b70edcef59","resolution":{"observed_at":"2026-08-09T17:37:39.496815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.206126Z","title":"BumbleBee: Secure Two-party Inference Frame- work for Large Transformers","venue":null,"work_id":"ba37c291-e6f3-4550-91a3-db2c27ca94c2","year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.498787Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:6ff94a32c47fd4f89d1bf4849d4de2a3b35863b0b0f4c6d255e075692403ea8f","observation_id":"19367cde-fe3b-4f0e-b017-bbd0653347c2","resolution":{"observed_at":"2026-08-09T17:37:40.208924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.191726Z","title":"Secure transformer infer- ence made non-interactive","venue":null,"work_id":"3fdc1784-7ef1-4890-84d2-9e3d1e9883fb","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.502964Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:fd22f675d626690aa74563a871b7c0f58725c2e24319f0e300fd3f7595c2d4eb","observation_id":"1b0a96f9-7cf6-43b7-8d4a-bccdc494eec1","resolution":{"observed_at":"2026-08-09T17:37:40.194371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14690","last_updated":"2025-02-25T21:00:50Z","snapshot_observed_at":"2026-07-06T19:06:19.400102Z","submitted_at":"2024-08-26T23:30:15Z","title":"Training-Free Activation Sparsity in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14690","snapshot_observed_at":"2026-08-09T17:37:39.505073Z","title":"Training-free activa- tion sparsity in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.505073Z"},"links":{"cited_paper":"/paper/2408.14690","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:5d6726fe0e321af8097e513637652ea178572d64bac0cf466eec6c0efdc45bd2","observation_id":"4e6321c5-dda7-4236-96aa-7c40970326c2","resolution":{"observed_at":"2026-08-09T17:37:39.505073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03804","last_updated":"2024-02-06T08:45:51Z","snapshot_observed_at":"2026-08-04T17:32:30.666755Z","submitted_at":"2024-02-06T08:45:51Z","title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03804","snapshot_observed_at":"2026-08-09T17:37:39.507833Z","title":"Relu2 wins: Discover- ing efficient activation functions for sparse llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.507833Z"},"links":{"cited_paper":"/paper/2402.03804","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:177d61be547cd8f4b8be23b207d1806aebd387a087b4c4c07384e12517e3913e","observation_id":"287bf1e2-4352-430b-ac76-5ab02d64ee48","resolution":{"observed_at":"2026-08-09T17:37:39.507833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.184730Z","title":"Relu strikes back: Exploiting activation sparsity in large lan- guage models","venue":null,"work_id":"9f3ebd11-f25b-4114-b4ee-c7b16c02a570","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.510440Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:b891a9e97ac78780e7df8060557afe531cc5c20cab43509d75817c5e1d101309","observation_id":"dcc82b43-ba2b-4f9a-b7d9-6cbb855b197e","resolution":{"observed_at":"2026-08-09T17:37:40.187461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.177217Z","title":"Smoothquant: Accu- rate and efficient post-training quantization for large language models","venue":null,"work_id":"81cecbf8-089f-411d-8b32-3ca1944819a7","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.512941Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:271691ee4247a6b2ca2bf43ec97bb938bc7506c5a40e8bd66910d774d23b30a8","observation_id":"288148a7-7b86-42e1-af4f-39648d09b0d8","resolution":{"observed_at":"2026-08-09T17:37:40.180020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.169864Z","title":"Omniquant: Omnidirection- ally calibrated quantization for large language models","venue":null,"work_id":"75dd5144-e036-40fe-8204-a7a252a0e9bf","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.515463Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:85cbfe77ce7c5f5fb89ef06fbe4545b52475fe8a0f11351c08b5805b50abc84e","observation_id":"a1d2126a-2aa5-4d7a-869f-5e4a87678d1a","resolution":{"observed_at":"2026-08-09T17:37:40.172593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.162455Z","title":"Sirnn: A math library for secure rnn inference","venue":null,"work_id":"baa66db2-bce8-4fbb-b646-37b775102a28","year":2021},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.517951Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:2ec82169e4a009b2f5cb9acb23815d01db3ba269845192c07aefc12f9c6e30c9","observation_id":"8c840334-b818-4007-91e1-3b4854e5963b","resolution":{"observed_at":"2026-08-09T17:37:40.165223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.155130Z","title":"From chatgpt to threat- gpt: Impact of generative ai in cybersecurity and privacy","venue":null,"work_id":"43c28479-fc97-4e60-a885-beae4576d54c","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.520323Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4307e7d2a76c7ae3cb38bfe0d608a107bf21337017b65e736d31ff5525a25519","observation_id":"4f1e32b9-8c20-42b2-84ef-e4f526db4df2","resolution":{"observed_at":"2026-08-09T17:37:40.157872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.147814Z","title":"Exploiting large language models (llms) through decep- tion techniques and persuasion principles","venue":null,"work_id":"69c4a995-2fa2-4382-9913-0abf9db1e299","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.522839Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:3ab3294733b38daa697058065a87ad925b62d755df7728090a9e487759b158bc","observation_id":"637b992f-b3f1-45cf-ba58-87c2879cdb14","resolution":{"observed_at":"2026-08-09T17:37:40.150589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11880","last_updated":"2024-08-20T06:45:50Z","snapshot_observed_at":"2026-07-06T17:18:44.456380Z","submitted_at":"2024-01-22T12:11:55Z","title":"PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11880","snapshot_observed_at":"2026-08-09T17:37:39.525244Z","title":"Psysafe: A comprehensive framework for psychological-based attack, defense, and evalua- tion of multi-agent system safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.525244Z"},"links":{"cited_paper":"/paper/2401.11880","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:ff5dc6853934fc87c30c4eba8452672e81f105139de33eee09186a72e623190c","observation_id":"4e4e6dbc-4e9c-4b45-afbe-ce3af4e2d85b","resolution":{"observed_at":"2026-08-09T17:37:39.525244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.527855Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.527855Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4590d707dc796bc9cd138a4e4d59b1fd4854346ee3266822742dafe69e21e82c","observation_id":"1ef5ecec-76c2-49c2-9151-df6e15127c28","resolution":{"observed_at":"2026-08-09T17:37:39.527855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-09T17:37:39.530426Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.530426Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:d83972f4121b66410bd36bb23d0681e700058693cc9fda76e5f62f83e6b4b437","observation_id":"c76fa3c1-23e2-4af4-95c2-8bb3a4510ec2","resolution":{"observed_at":"2026-08-09T17:37:39.530426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.136811Z","title":"Di- rect preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"28983297-ccfb-4d77-a5c2-cb63fbc344bd","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.533289Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:a77be52411026aac0dbe2ab8feda0ff6055838c4de2c11d56cd21b04971aa893","observation_id":"990fe8fb-ecd8-4a21-a561-8001f009b155","resolution":{"observed_at":"2026-08-09T17:37:40.139508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-09T17:37:39.535809Z","title":"Fine- tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.535809Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:502e165f5a24aeac149bfc98b4fdd1862486dc680e805d13778186448a041a0a","observation_id":"28292dea-c199-4d8d-b0c6-068dbfc45920","resolution":{"observed_at":"2026-08-09T17:37:39.535809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16833","last_updated":"2025-01-05T21:51:46Z","snapshot_observed_at":"2026-07-31T00:03:11.135660Z","submitted_at":"2024-05-27T05:04:05Z","title":"Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16833","snapshot_observed_at":"2026-08-09T17:37:39.538531Z","title":"Safe lora: the silver lining of reducing safety risks when fine-tuning large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.538531Z"},"links":{"cited_paper":"/paper/2405.16833","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:c8d4c7481b2bd9ccde054cd8065f1bf973a2619a294ee80f5130bd7cefb45a07","observation_id":"21dcb9ae-d6d4-444f-96b0-4f402b7abfbe","resolution":{"observed_at":"2026-08-09T17:37:39.538531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-09T17:37:39.541244Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.541244Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:bf42d3f488dacf6243f57114a95d7f945984757dc74dee50501252992dd2c84f","observation_id":"648e5c71-b1cd-46a7-b4ce-4f903832b0df","resolution":{"observed_at":"2026-08-09T17:37:39.541244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.129640Z","title":"A simple and effective pruning approach for large lan- guage models","venue":null,"work_id":"ef12953b-3bfe-4e9a-b468-5d91f0e7fb1f","year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.544127Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:758aee06c3216e72e1e6d093e7a7e3dafa833122485cb926fe412e53610e7b13","observation_id":"554ca386-87ae-4910-a4bb-96a9a97df6b0","resolution":{"observed_at":"2026-08-09T17:37:40.132421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.122754Z","title":"Dynamic context pruning for efficient and interpretable autoregressive transformers","venue":null,"work_id":"f50a8f67-1d95-40e3-830c-6ecc6a6ee4a3","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.546825Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:e81210524370febc7e5e68376d04e97cdca1c166084a840dba9d18ebddcc5fd9","observation_id":"eb45a763-0ab2-44c5-be77-10d227b55ad4","resolution":{"observed_at":"2026-08-09T17:37:40.125481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.115813Z","title":"Adapting language models to compress contexts","venue":null,"work_id":"4171fa87-4ad1-4518-842d-aeb913485c0f","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.549206Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:0caf86a056f9a894920ddfa4123f6f962c89e387a6c4f64c4b0d03a5a8ae316d","observation_id":"7ce3b523-7318-4acf-8037-686931756f86","resolution":{"observed_at":"2026-08-09T17:37:40.118461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.108564Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache manage- ment","venue":null,"work_id":"f18d5a9e-28c1-4dbf-980b-f3e66aa5fb86","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.551730Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4bd5535bc2edc92ad79ce48524919aa167d9c5a4783caed56e11f98389a3102a","observation_id":"c805132b-81c1-4aa9-86dc-05ae00074791","resolution":{"observed_at":"2026-08-09T17:37:40.111328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.102010Z","title":"{IMPRESS}: An {Importance- Informed}{Multi-Tier} prefix {KV} storage system for large language model inference","venue":null,"work_id":"4a8b9e55-e5be-4a83-8f59-76cc68130e48","year":2025},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.554120Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:6cac8e4ee1cc8bce57e91f060dd520f4786218d58fb76cbcca966c43b7c8dec9","observation_id":"71451ffd-5c83-4a1e-a185-f5420ad3677c","resolution":{"observed_at":"2026-08-09T17:37:40.104171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.095845Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"bae37143-b407-4729-935d-a8879c186db3","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.556605Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:0a532a1af0c94438452d53d5f7ee0f0f20db9e0a0f4bf3af7bc15658956f2a6f","observation_id":"3a1c35c4-aa16-4794-9217-f105d484939a","resolution":{"observed_at":"2026-08-09T17:37:40.098118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.089358Z","title":"Kvquant: Towards 10 million con- text length llm inference with kv cache quantization","venue":null,"work_id":"a6cbc8f9-a167-4cc3-937a-87c9c939f068","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.559046Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:2d4bad1901dc5fe3fddc2001c844b6c2ba274678556fc0f94ca8a693b30a8995","observation_id":"e7788879-bce4-4f23-b5e5-cc32f49dd2cb","resolution":{"observed_at":"2026-08-09T17:37:40.091674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.082978Z","title":"Sequoia: Scalable and robust speculative de- coding","venue":null,"work_id":"dbd22761-cc15-4bbf-9682-f89336c761cc","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.561483Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:0aa358b168836458396d2c7dba5d01a6298ff17a3e12c1e623783da228797756","observation_id":"10aad630-7787-44c9-855c-ac005805c07b","resolution":{"observed_at":"2026-08-09T17:37:40.085231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.075380Z","title":"Decoding compressed trust: Scrutinizing the trustworthiness of efficient llms under compression","venue":null,"work_id":"8492b24a-3fb5-431a-9fd1-817fcaf9e975","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.563904Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4b937e5feb8f3f887971fac6008ad9bd4f5e2b6bd0cdf5718646d47f6e9bf8b3","observation_id":"48c61911-7bba-476a-bea3-44a973b2df16","resolution":{"observed_at":"2026-08-09T17:37:40.078252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.068090Z","title":"Harmlevelbench: Evaluating harm-level compliance and the impact of quantization on model alignment","venue":null,"work_id":"d571d2bb-1e3c-4a8a-98c1-aeb023a7674a","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.566243Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:f2a20bfaa0dab9e42992595dd34bc29498dec1fc47094f24a07e999d2779dd2e","observation_id":"45a28834-227a-4d5b-8201-4e64193306de","resolution":{"observed_at":"2026-08-09T17:37:40.070834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.061007Z","title":"Exploiting llm quantization","venue":null,"work_id":"1f5c40e5-41cf-48d1-a097-3bb6bf8a229e","year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.568667Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:7af9cf1ecff0d2997d9fb04e2aafe4bc14030af99807b9309a1385c8dc04c51c","observation_id":"5b8a9931-e89a-415e-892e-742fb4724cb2","resolution":{"observed_at":"2026-08-09T17:37:40.063577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.053552Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"8871f330-7dd2-40e2-9c94-f940813db651","year":2022},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.571296Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:657eacec4857e90e2f9834c5b3f7a4a61d3f764849a8a00629b9c21938e28751","observation_id":"ceffec12-a271-4d19-b0cb-f420f35f503f","resolution":{"observed_at":"2026-08-09T17:37:40.056232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.045454Z","title":"Qllm: Accurate and efficient low-bitwidth quantization for large language models.In- ternational Conference on Machine Learning, 2024","venue":null,"work_id":"f55bf806-8004-4ac1-88a3-5e3948571e58","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.573726Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:236cef48208e3970a757d5e3945d971b93782cded5223676a44855ecd7f3fafe","observation_id":"58b43f76-c1a2-4ce1-b0e4-34a321323825","resolution":{"observed_at":"2026-08-09T17:37:40.048307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.575830Z","title":"Introducing meta llama 3: The most capable openly available llm to date","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.575830Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:599188d9e5b658ca7977a9ce2324b222f1f6d170b868c391cc1862a7e49db3d2","observation_id":"4b9e6550-0094-4b81-ad21-6164bfb5beee","resolution":{"observed_at":"2026-08-09T17:37:39.575830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.034315Z","title":"Mpcformer: fast, performant and private transformer inference with mpc","venue":null,"work_id":"e30d2e8e-839d-48fa-8956-8bdedca97621","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.577796Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:2055b9fd0eba98939d5d482ac93d34b700d2df658186a8ba0e79dd9a6bd56c70","observation_id":"036314c3-df4a-428e-85ef-917363701540","resolution":{"observed_at":"2026-08-09T17:37:40.037095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02486","last_updated":"2025-02-21T01:13:08Z","snapshot_observed_at":"2026-08-05T09:53:25.030382Z","submitted_at":"2024-10-03T13:48:35Z","title":"Encryption-Friendly LLM Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02486","snapshot_observed_at":"2026-08-09T17:37:39.579915Z","title":"Encryption-friendly llm architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.579915Z"},"links":{"cited_paper":"/paper/2410.02486","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:721dcccf342a238d07ed657ad9d68a48fbacd3bcc6b61be1210a28724feed46f","observation_id":"bdb1cc3d-e089-4a1e-9e20-bf96c91f299b","resolution":{"observed_at":"2026-08-09T17:37:39.579915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.026801Z","title":"Deja vu: Con- textual sparsity for efficient llms at inference time","venue":null,"work_id":"6ceebc74-920a-42f3-8c19-e3b2471f9602","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.582055Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:09c816e3a276b5edde89e2530645be3faa391275630230ed45140f4623babcdb","observation_id":"9f2ac483-69c7-42ab-bbfb-31c9b162cb94","resolution":{"observed_at":"2026-08-09T17:37:40.029642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.019233Z","title":"Cats: Context-aware thresh- olding for sparsity in large language models","venue":null,"work_id":"81feabf3-a519-446d-b775-a6fdb815bcfa","year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.584000Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:8a25f891d31a9cefda2b0d9dae1948e073d5143b0ea914f3ac1e76b1728ed9c3","observation_id":"6da7ef52-b474-4671-86df-2cb90b6c996c","resolution":{"observed_at":"2026-08-09T17:37:40.022246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.586311Z","title":"Judging llm-as- a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.586311Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:045f5158061cf85466a34e34d9edc32384c8a5a957c5138ab709c90fed9cec3a","observation_id":"d9906681-c789-4184-9a25-d9900b8443bc","resolution":{"observed_at":"2026-08-09T17:37:39.586311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.008108Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifica- tions","venue":null,"work_id":"f7d8a56d-e695-4fd0-b230-b162f69ae13b","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.588409Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:d75434c89afdbee69a49da2688c6b5490c924e5621a44898434e392b6f77006d","observation_id":"04a0dd48-3eb6-413b-94ef-63469149a2a4","resolution":{"observed_at":"2026-08-09T17:37:40.010797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18169","snapshot_observed_at":"2026-08-09T17:37:39.590442Z","title":"Harmful fine-tuning attacks and defenses for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.590442Z"},"links":{"cited_paper":"/paper/2409.18169","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:6f0ec5894529f0f925edd40961799d4511a76edbc6658908c812ed8342eb1476","observation_id":"f9eaa58c-f081-48d1-9de3-5221b7b1162b","resolution":{"observed_at":"2026-08-09T17:37:39.590442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.000637Z","title":"Lisa: Lazy safety alignment for large language models against harmful fine-tuning at- tack","venue":null,"work_id":"5076db97-d29a-4d02-bcaa-1175a5114338","year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.593006Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:ed78417e43e7acc79d02481423c27a54a868fb338b5f006c94df4ae977fb93ce","observation_id":"b32f45a2-16e6-49de-8886-851d2c32f982","resolution":{"observed_at":"2026-08-09T17:37:40.003409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-09T17:37:39.595425Z","title":"Universal and trans- ferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.595425Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:44029ba95a2038d5cd111c4794b324dd642f3c67097782897e1792f7f762d5d8","observation_id":"a5fb86ba-5cd5-4115-adb7-184980feab14","resolution":{"observed_at":"2026-08-09T17:37:39.595425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-09T17:37:39.598235Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.598235Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:b82d3ffa8a019e386e6b26cecee47c18ddfbc01fcafcabaee9f6e6c3f646ec8d","observation_id":"a2012904-6ca2-4b52-8886-23136f88c45a","resolution":{"observed_at":"2026-08-09T17:37:39.598235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14472","last_updated":"2024-05-28T09:11:25Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:18:30Z","title":"Detoxifying Large Language Models via Knowledge Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14472","snapshot_observed_at":"2026-08-09T17:37:39.600920Z","title":"Detoxifying large language models via knowledge editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.600920Z"},"links":{"cited_paper":"/paper/2403.14472","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:422788961fa4b121eedf33057ae9e1eeca6fd4d46669fca6fd11644c078717db","observation_id":"e98b3c49-8494-4c98-9d5a-0b2b8460beac","resolution":{"observed_at":"2026-08-09T17:37:39.600920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10208","last_updated":"2024-07-01T12:48:51Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:59:02Z","title":"Recovering the Pre-Fine-Tuning Weights of Generative Models","version":2},"cited_work":{"arxiv_id":"2402.10208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10208","snapshot_observed_at":"2026-08-09T17:37:39.815881Z","title":"Recovering the Pre-Fine-Tuning Weights of Generative Models","venue":"cs.LG","work_id":"617b39d5-311e-4ade-9dbc-8e2c5b00c622","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.603681Z"},"links":{"cited_paper":"/paper/2402.10208","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:7e74ba7e605be74b849776b582b423eda0bef8928c8fd439b46560c1b2e2c5e0","observation_id":"9ed5edc6-4186-4910-8e00-71df8537532c","resolution":{"observed_at":"2026-08-09T17:37:39.818906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13669","last_updated":"2024-05-28T06:39:17Z","snapshot_observed_at":"2026-08-09T22:54:11.912855Z","submitted_at":"2024-02-21T10:06:08Z","title":"Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13669","snapshot_observed_at":"2026-08-09T17:37:39.606386Z","title":"Self-distillation bridges distribution gap in language model fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.606386Z"},"links":{"cited_paper":"/paper/2402.13669","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:a6d48b6105895287df4c4c5d9ba40f6e4bac8ff352f9fa8bfb329ee6b66c61cd","observation_id":"dcecaae4-378e-4c13-a3a7-3cc5ef393661","resolution":{"observed_at":"2026-08-09T17:37:39.606386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18540","last_updated":"2025-01-17T01:43:21Z","snapshot_observed_at":"2026-08-09T01:10:23.759600Z","submitted_at":"2024-02-28T18:23:49Z","title":"Keeping LLMs Aligned After Fine-tuning: The Crucial Role of Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18540","snapshot_observed_at":"2026-08-09T17:37:39.609496Z","title":"Keeping llms aligned after fine-tuning: The crucial role of prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.609496Z"},"links":{"cited_paper":"/paper/2402.18540","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:6b8b48f27a9c98985423347580875fafc4c0ad1cdf778f7bf9192e834b3cf7bb","observation_id":"0d6d80ec-20af-4486-bbc5-73332f878ca0","resolution":{"observed_at":"2026-08-09T17:37:39.609496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07471","last_updated":"2024-10-11T01:05:22Z","snapshot_observed_at":"2026-08-08T09:07:14.280048Z","submitted_at":"2024-10-09T22:24:22Z","title":"SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07471","snapshot_observed_at":"2026-08-09T17:37:39.612801Z","title":"Seal: Safety-enhanced aligned llm fine-tuning via bilevel data selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.612801Z"},"links":{"cited_paper":"/paper/2410.07471","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:1744c973f7ee0a7926f3a605f4f096af05fa6d30fc6266df2cf3727b93ffd80d","observation_id":"c1a338de-b2c4-4f79-8bcc-dacded386d85","resolution":{"observed_at":"2026-08-09T17:37:39.612801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01382","last_updated":"2024-03-17T00:38:59Z","snapshot_observed_at":"2026-08-10T03:24:03.444561Z","submitted_at":"2023-10-02T17:42:37Z","title":"Compressing LLMs: The Truth is Rarely Pure and Never Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01382","snapshot_observed_at":"2026-08-09T17:37:39.615850Z","title":"Compressing llms: The truth is rarely pure and never simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.615850Z"},"links":{"cited_paper":"/paper/2310.01382","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4ea6a9f53e882a9bd3f64ccb82a71df8e5026c02b99b08d93365167d04040d62","observation_id":"6a15da23-7dd0-4138-8b6c-b2475b3ffc78","resolution":{"observed_at":"2026-08-09T17:37:39.615850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05175","last_updated":"2025-06-30T22:16:39Z","snapshot_observed_at":"2026-08-01T08:08:15.221032Z","submitted_at":"2023-10-08T14:22:58Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05175","snapshot_observed_at":"2026-08-09T17:37:39.618406Z","title":"Outlier weighed layerwise sparsity (owl): A missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.618406Z"},"links":{"cited_paper":"/paper/2310.05175","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:46b20ce56f38dfbfac4316f668915428057ae6ab1da401563a4b097fe6b25f89","observation_id":"960c1af9-ac41-4784-877c-0b3489ae88f3","resolution":{"observed_at":"2026-08-09T17:37:39.618406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.993259Z","title":"Discovering sparsity allo- cation for layer-wise pruning of large language models","venue":null,"work_id":"0f31b008-15cf-4403-a1a1-02ec124567ff","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.620977Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:ccc0a05def31f0697f9a18acd237fdc08199529a99083fa4593845055de24025","observation_id":"d45dd858-0691-4600-b9dd-4eca0d8c4165","resolution":{"observed_at":"2026-08-09T17:37:39.996108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04965","last_updated":"2024-10-11T22:43:36Z","snapshot_observed_at":"2026-08-05T05:39:32.019510Z","submitted_at":"2024-07-06T05:56:22Z","title":"Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04965","snapshot_observed_at":"2026-08-09T17:37:39.623449Z","title":"Beyond perplexity: Multi-dimensional safety evaluation of llm compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.623449Z"},"links":{"cited_paper":"/paper/2407.04965","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:6d84b09ebefdb57f3e799b7b8aed31b36a9f30afe7842332fa1bab51c64255ee","observation_id":"63d92d98-cf18-45a9-a45d-6a71f0bcdb09","resolution":{"observed_at":"2026-08-09T17:37:39.623449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03171","last_updated":"2025-02-09T19:46:51Z","snapshot_observed_at":"2026-08-05T11:28:56.664087Z","submitted_at":"2024-11-05T15:19:29Z","title":"Navigating Extremes: Dynamic Sparsity in Large Output Spaces","version":3},"cited_work":{"arxiv_id":"2411.03171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.03171","snapshot_observed_at":"2026-08-09T17:37:39.767447Z","title":"Navigating Extremes: Dynamic Sparsity in Large Output Spaces","venue":"cs.LG","work_id":"0009cd34-9f56-4f47-b031-58624e5d958e","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.626079Z"},"links":{"cited_paper":"/paper/2411.03171","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:95af182f174a21a6352b8c684c0f23ffa46eccd2f536cff516a4fc8f7d61b2eb","observation_id":"a13e492f-863c-42fb-816e-a0528327c55a","resolution":{"observed_at":"2026-08-09T17:37:39.772417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-09T17:37:39.628959Z","title":"Catastrophic jailbreak of open- source llms via exploiting generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.628959Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:f2b8270d03c86b01048756127e737e252c88b675e2f0460c3124d0c924d770ad","observation_id":"840f2a7a-b166-4dbd-8102-4b404d28ec5f","resolution":{"observed_at":"2026-08-09T17:37:39.628959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-08-09T17:37:39.631778Z","title":"Trustllm: Trustwor- thiness in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.631778Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:be79c6d05bb9259f14a85f737258b402a0dbd22f1ef3d4784feddc55653bc568","observation_id":"67235692-f973-4818-a960-1f910571583d","resolution":{"observed_at":"2026-08-09T17:37:39.631778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-09T17:37:39.634473Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.634473Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:2bdc59878dbba8c31196895002180a531e57b9a8661aff16b051b6e5f50e6d55","observation_id":"aa89ebd6-d450-44d1-9013-7aa020b7f05f","resolution":{"observed_at":"2026-08-09T17:37:39.634473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.986227Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":"572ef855-c524-4ec5-9b65-1d37eb6c68ac","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.637030Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:2d63ce1763545a266708d7b85caeda72c187a27253bc4ba1f5126286473950f2","observation_id":"778cdd0d-f1e7-4867-b52e-1cc7557956df","resolution":{"observed_at":"2026-08-09T17:37:39.988585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.979708Z","title":"Automatically auditing large language mod- els via discrete optimization","venue":null,"work_id":"cd7e0332-6fe1-4301-a2e8-f270c1f3f4a1","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.639157Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:decabed9b8b18ebfe42deb2f6e9d091b51c5dac006c57acc0cd1aa765cec8965","observation_id":"7cdadd0f-7f26-40e0-83d7-617cc7654d8e","resolution":{"observed_at":"2026-08-09T17:37:39.981980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.973169Z","title":"Making them ask and an- swer: Jailbreaking large language models in few queries via disguise and reconstruction","venue":null,"work_id":"af325e64-6cc8-443f-b114-a573d55ef519","year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.641111Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4b3ed17bc29d517a7e3f660a0c0fa488ec14ae2aa17d5483eb76a5b625383fcd","observation_id":"894c6b5b-92f3-4d3d-9ee8-b8e810b3b87f","resolution":{"observed_at":"2026-08-09T17:37:39.975523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.965993Z","title":"Beavertails: Towards im- proved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"7b808f7b-a63b-4a0f-a2c7-7c44e07f223e","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.643119Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:d8f4ccef87d74f9d13c9c75ef5291f7c6f7744f9881acc0f360af079ed480d55","observation_id":"5df229dc-92c6-4790-b0ac-a7dcdadbf21b","resolution":{"observed_at":"2026-08-09T17:37:39.968993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-09T17:37:39.645158Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.645158Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:3beb1da205d4a036e99e4bbb7a72211ce823e9d3ece279c1ca3e12792739fde6","observation_id":"334cc4f1-54fd-45de-949c-8bb81b5e6779","resolution":{"observed_at":"2026-08-09T17:37:39.645158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-09T17:37:39.647318Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.647318Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:afa9032029726a349e6c139cc6781aef41bdc8143d162aa9db083eeb4008d40b","observation_id":"8e3347ca-54f3-4957-8d95-4b6af5c0d62e","resolution":{"observed_at":"2026-08-09T17:37:39.647318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.958542Z","title":"Qlora: Efficient finetuning of quan- tized llms","venue":null,"work_id":"2d3f872b-d983-4860-932f-480ae2db73b2","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.649851Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:e8d00b04fb98723ce2e1b7eb93e787d1137a7ff41efeb8afdd0fa307374534ad","observation_id":"00071c23-c419-4149-b7ba-be718d7fb249","resolution":{"observed_at":"2026-08-09T17:37:39.961340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-09T17:37:39.651866Z","title":"Phi-3 technical report: A highly capable lan- guage model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.651866Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:3c788789f1eb678320e91bedec434b1e7b2739c9d441bac1f1a9876b1a8277a9","observation_id":"eb141789-1fd9-4c8f-895b-2aebe0be15ac","resolution":{"observed_at":"2026-08-09T17:37:39.651866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T17:37:39.654525Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.654525Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:d5c8f189f417ef720a7c416e3b4f1c9ef779cb5e9b54b8ad386cf40d7f19eea9","observation_id":"ccb460b1-b160-421d-a89a-934d83896715","resolution":{"observed_at":"2026-08-09T17:37:39.654525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-09T17:37:39.657148Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.657148Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:7a5e8261a025dff099a034da6eec4f1285273b4c115b30caadbeb69f3f738bf2","observation_id":"5bd9bd37-2bfb-4474-83a5-fff8d3c9e48c","resolution":{"observed_at":"2026-08-09T17:37:39.657148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-09T17:37:39.660075Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.660075Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4f838cb42cb1f7c4220b24767eac1b37f968cf4d17825276c12e7924d9256744","observation_id":"faabd1bf-74b9-4db4-8168-81affad895e7","resolution":{"observed_at":"2026-08-09T17:37:39.660075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.662669Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.662669Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:d547d2a6ff0d611d9b62925b6883826c67c9977e4b9ea3e2ed8dbaeafe3ad93b","observation_id":"5a5aa9ea-1b8c-4af4-8fb0-b5de3faa4aee","resolution":{"observed_at":"2026-08-09T17:37:39.662669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.665104Z","title":"Language models are few-shot learn- ers","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.665104Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:fdbc294e0a920831a58e4a28c61d7616872c3e991dc6dbd5dc90e57bd69b71e0","observation_id":"8efe3443-9481-48b6-a96d-ff673f06b509","resolution":{"observed_at":"2026-08-09T17:37:39.665104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.667643Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.667643Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:fd650d95a02a77fd7c8b0cb331b7685cda7771d6a6ea1619faf662d2cd4bf30d","observation_id":"4a7600c1-c273-4d04-9415-e4c8c40dab33","resolution":{"observed_at":"2026-08-09T17:37:39.667643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-07-06T20:11:46.794148Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-08-09T17:37:39.670171Z","title":"Shaping the safety boundaries: Understanding and defending against jailbreaks in large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.670171Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:4bb36dddd35fcbb5edabd6a53328825b6b86f31c743e3986d0ebd5a38d2740da","observation_id":"553ca044-2223-4d81-820c-df4a5472aaea","resolution":{"observed_at":"2026-08-09T17:37:39.670171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-09T17:37:39.672901Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.672901Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:dca4b5b3daf01233fb78787e5c80acc14252efdcaa7d5e794bc3f356ec3ec61d","observation_id":"8404c6c5-62b5-44a5-b9bd-9a2607544e79","resolution":{"observed_at":"2026-08-09T17:37:39.672901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:39.939573Z","title":"Stanford alpaca: An instruction- following llama model, 2023","venue":null,"work_id":"3fceac34-c5fd-4803-98ca-aecf3f6cf28e","year":2023},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.675692Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:d54f138901ea6190883c6873b79791d200821a66e4197dfcfdf539c29112ca50","observation_id":"5f45c01d-dfe1-44ed-96e7-a634fb74bb6f","resolution":{"observed_at":"2026-08-09T17:37:39.942588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:37:40.199025Z","title":null,"venue":null,"work_id":"15933fe0-1e87-4f5b-8ef4-0c9a03140001","year":2025},"citing_paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T17:37:39.500970Z"},"links":{"citing_paper":"/paper/2502.00840"},"observation_digest":"sha256:7307cd97f36052ff420aff155929f402db97e9a681e47c85e6dfd8b652de3ed6","observation_id":"fa618968-8898-4dca-a5ae-b76e4f6f171f","resolution":{"observed_at":"2026-08-09T17:37:40.201564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00840","last_updated":"2025-06-10T17:24:15Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-10T00:46:53.798153Z","submitted_at":"2025-02-02T16:25:48Z","title":"Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 2 inbound Pith citation observations for arXiv:2502.00840."}