{"as_of":"2026-08-08T19:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0686e9ea6e1ee1e91b91f84c2d638b7d36a90ec6c3d2eb303fdba3d61b4b3d60","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:42:31.580341Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21004/citation-record","integrity":"/paper/2508.21004/integrity","json":"/paper/2508.21004/citation-record.json","paper":"/paper/2508.21004"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19334","last_updated":"2024-06-03T16:19:03Z","snapshot_observed_at":"2026-07-06T17:37:34.047076Z","submitted_at":"2024-02-29T16:37:08Z","title":"Here's a Free Lunch: Sanitizing Backdoored Models with Model Merge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19334","snapshot_observed_at":"2026-08-05T14:42:31.364363Z","title":"Here’s a free lunch: Sanitizing backdoored models with model merge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.364363Z"},"links":{"cited_paper":"/paper/2402.19334","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:34ff26ac3da7cf14b090dc80bab5a568c3da87b3ee92e291b94fd244f647c974","observation_id":"a0a5d895-d301-4c74-886d-c40632fdf25c","resolution":{"observed_at":"2026-08-05T14:42:31.364363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.383052Z","title":"How to backdoor federated learning","venue":null,"work_id":"612b8f39-2b35-4357-8077-2fb8ea02c920","year":2020},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.368634Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c6b80ce3ef045e3e149ef366966662460dc908279b5c9afb629ef9a41fddc24d","observation_id":"c5811157-051e-4fe1-9ea9-f33955ee1f64","resolution":{"observed_at":"2026-08-05T14:42:32.386381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T14:42:31.372096Z","title":"Training a helpful and harmless assistant with reinforce- ment learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.372096Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:11a06ff9d0bcdd7032a90ad9eddd6c674da735abc1c8bf64c959aad4a9053818","observation_id":"d96958ec-2210-461b-9389-96461161e00e","resolution":{"observed_at":"2026-08-05T14:42:31.372096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T14:42:31.376514Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.376514Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:06059bf739fce2862c212ea92cd53a95cdd588c222a29a7a81ef56e6631683f0","observation_id":"dad8bf1a-ed63-4728-b820-5001d9322427","resolution":{"observed_at":"2026-08-05T14:42:31.376514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.373053Z","title":"Backdoor attacks and coun- termeasures in natural language processing models: A comprehensive security review","venue":null,"work_id":"f0afdbdb-83c9-4c10-bddb-241e0849044d","year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.380182Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:df8e2b6f1e66705efb949df700de52a2a950a80ee4ea18d2832dca7a98f09ce3","observation_id":"bfe74251-2c9b-4027-b210-a1a5df4ce454","resolution":{"observed_at":"2026-08-05T14:42:32.377285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10760","last_updated":"2020-08-02T08:38:25Z","snapshot_observed_at":"2026-07-06T09:40:34.148418Z","submitted_at":"2020-07-21T12:49:12Z","title":"Backdoor Attacks and Countermeasures on Deep Learning: A Comprehensive Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10760","snapshot_observed_at":"2026-08-05T14:42:31.383618Z","title":"Backdoor attacks and countermeasures on deep learning: A comprehensive review","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.383618Z"},"links":{"cited_paper":"/paper/2007.10760","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:4eab0434b199c2c3cb44822c8f979373cc4f6f7ea8ddb38dd4646f5fa9042cc4","observation_id":"3bf82dd6-96ae-4695-b69d-5ff9894baa90","resolution":{"observed_at":"2026-08-05T14:42:31.383618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-02T11:25:49.310871Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-08-05T14:42:31.387903Z","title":"Arcee’s mergekit: A toolkit for merging large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.387903Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:74613da988732be4dc2b2bdecdd08c3957127f01e2d3eabc918ac94399c96b4e","observation_id":"8aa7dde6-4bfb-4860-bd96-e88ddc227d69","resolution":{"observed_at":"2026-08-05T14:42:31.387903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.363121Z","title":"Defense-resistant backdoor attacks against deep neural networks in outsourced cloud environment","venue":null,"work_id":"66f8cae8-dee0-49a1-90b2-41edb41a0cdb","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.391436Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:d0603a6512d3d83162b4767381db9eb549d6aafa95da8c6dcac99d4b18192f1f","observation_id":"ba410568-ab14-4ac7-82c5-2cfbc8b0f022","resolution":{"observed_at":"2026-08-05T14:42:32.367132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.353261Z","title":"Redeem myself: Purifying backdoors in deep learning models using self attention distillation","venue":null,"work_id":"c56d5f27-84bb-4bdb-8864-cab9e4f0e2e7","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.394531Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:a1570691ea79c33c3eaeefb6388b96302e0a49ba9ea121de3dd34bcc51ce4361","observation_id":"760e78b0-82b2-4f4f-aa8a-187b83f41cd7","resolution":{"observed_at":"2026-08-05T14:42:32.356699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:42:31.397826Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.397826Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:21d9370fbf5b992be669fb61a22c5803b5267865a6b5467d7e245669881f4d80","observation_id":"98c8c21b-383a-45e0-8c63-4396c1c25704","resolution":{"observed_at":"2026-08-05T14:42:31.397826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02406","last_updated":"2024-04-03T02:16:53Z","snapshot_observed_at":"2026-08-06T08:04:06.949889Z","submitted_at":"2024-04-03T02:16:53Z","title":"Exploring Backdoor Vulnerabilities of Chat Models","version":1},"cited_work":{"arxiv_id":"2404.02406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02406","snapshot_observed_at":"2026-08-05T14:42:31.990587Z","title":"Exploring Backdoor Vulnerabilities of Chat Models","venue":"cs.CR","work_id":"b45c52ff-9d48-46dc-b477-c0779daae18b","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.401901Z"},"links":{"cited_paper":"/paper/2404.02406","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:5e44e744c22a4e560d630572f1a546681542b41e14b6643592b8bf6ee1e49e7b","observation_id":"86752fb4-e2b1-4eef-96c7-5cacb05e0185","resolution":{"observed_at":"2026-08-05T14:42:31.994313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04690","last_updated":"2022-11-15T09:57:23Z","snapshot_observed_at":"2026-08-08T06:54:37.328636Z","submitted_at":"2021-06-08T20:58:23Z","title":"Handcrafted Backdoors in Deep Neural Networks","version":2},"cited_work":{"arxiv_id":"2106.04690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04690","snapshot_observed_at":"2026-08-05T14:42:31.978802Z","title":"Handcrafted Backdoors in Deep Neural Networks","venue":"cs.CR","work_id":"5675c3fc-8c2c-452c-9ba9-ea7918d364e2","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.405190Z"},"links":{"cited_paper":"/paper/2106.04690","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:621be4fc49c24aadf07796aa4e2a6b9bc436b9124a57104bf50741b35cb219da","observation_id":"b57f3095-a490-4e6a-9aa9-d7567f752f36","resolution":{"observed_at":"2026-08-05T14:42:31.982234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T14:42:31.408645Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.408645Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:8bb788e65bffe5779216d674680b21775eb4de86cb769888dd524ff9fa318cd2","observation_id":"ed51ec82-d691-4b83-a3bc-9eacd219e75b","resolution":{"observed_at":"2026-08-05T14:42:31.408645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07676","last_updated":"2024-03-30T16:09:34Z","snapshot_observed_at":"2026-07-06T16:31:21.196640Z","submitted_at":"2023-10-11T17:21:03Z","title":"Composite Backdoor Attacks Against Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07676","snapshot_observed_at":"2026-08-05T14:42:31.411783Z","title":"Composite backdoor at- tacks against large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.411783Z"},"links":{"cited_paper":"/paper/2310.07676","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:fabcbc5b8e2ad71757d16aad1c380f5430b6b916306de80138164a7a7ec8608f","observation_id":"a825e185-76da-4ed5-a184-b976771b1aae","resolution":{"observed_at":"2026-08-05T14:42:31.411783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-05T14:42:31.415328Z","title":"Sleeper agents: Training deceptive LLMs that persist through safety training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.415328Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:cc5a303e9b47927df26f008a642b5e0f5398a42a90c95784ff62300c6ea5e84d","observation_id":"98a517cc-c1bb-43c6-9687-638b11835ac7","resolution":{"observed_at":"2026-08-05T14:42:31.415328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-05T14:42:31.418317Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.418317Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:dd715a9934866a37b51d99154855e354dd357dedbfae6b5cdfc173e7f76dccb8","observation_id":"8c267720-eef9-4c24-ad4e-bd60def996a6","resolution":{"observed_at":"2026-08-05T14:42:31.418317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.343747Z","title":"Chatgpt for good? On opportunities and challenges of large language models for education","venue":null,"work_id":"c6a8d222-5f92-44e7-9a35-3284e39a6c1c","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.421550Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c7e7cb841b8ff00084545a8ccbd0081f2caf4e0ef9176d7eea3e29101c768abe","observation_id":"79033d8d-3c5a-4c77-9892-0f9d7bbb0aaa","resolution":{"observed_at":"2026-08-05T14:42:32.347320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:31.424498Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.424498Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:0ab379f043b65ebecb82acc4fc839cb60ca49db1ddfbf88304ec58c6399dd677","observation_id":"dcd67056-6a5a-48ab-af8d-b7dc016a58ad","resolution":{"observed_at":"2026-08-05T14:42:31.424498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13888","last_updated":"2021-08-31T14:47:37Z","snapshot_observed_at":"2026-07-06T11:43:05.180555Z","submitted_at":"2021-08-31T14:47:37Z","title":"Backdoor Attacks on Pre-trained Models by Layerwise Weight Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13888","snapshot_observed_at":"2026-08-05T14:42:31.427248Z","title":"Backdoor attacks on pre- trained models by layerwise weight poisoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.427248Z"},"links":{"cited_paper":"/paper/2108.13888","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:b1f1b9bd35549ef0c7931ce0a5709845efd3f17ebe48367fee8ed4c36b5a7230","observation_id":"16f98be6-3927-4e38-86e2-ce47f1e565ff","resolution":{"observed_at":"2026-08-05T14:42:31.427248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:31.430104Z","title":"Chain-of-scrutiny: Detecting backdoor 15 attacks for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.430104Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f0987f34766cf20f58f7fb57af9c21e1e4820369dafab864913873144f4c2af6","observation_id":"5bd34cf6-b537-42ca-9290-cb484ca80d23","resolution":{"observed_at":"2026-08-05T14:42:31.430104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13355","last_updated":"2024-03-20T07:34:18Z","snapshot_observed_at":"2026-08-07T22:23:06.111813Z","submitted_at":"2024-03-20T07:34:18Z","title":"BadEdit: Backdooring large language models by model editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13355","snapshot_observed_at":"2026-08-05T14:42:31.432721Z","title":"Badedit: Backdooring large language mod- els by model editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.432721Z"},"links":{"cited_paper":"/paper/2403.13355","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:d5ee121b5a4c09d996852a3c1dc852038cc9e442eb91cd50ece03f5ac15e8a9e","observation_id":"96acead6-99a4-4235-83b9-d97f02eb7c00","resolution":{"observed_at":"2026-08-05T14:42:31.432721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08350","last_updated":"2023-06-14T08:38:51Z","snapshot_observed_at":"2026-07-06T15:42:25.794343Z","submitted_at":"2023-06-14T08:38:51Z","title":"Multi-target Backdoor Attacks for Code Pre-trained Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08350","snapshot_observed_at":"2026-08-05T14:42:31.435614Z","title":"Multi-target backdoor attacks for code pre-trained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.435614Z"},"links":{"cited_paper":"/paper/2306.08350","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:be09d51562c008d9b2d3c7d3ef24bbe174f9a33a75225ea585f25daa8a9b89c9","observation_id":"b5012e99-a571-485f-9ab2-bbf7774931db","resolution":{"observed_at":"2026-08-05T14:42:31.435614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.327769Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":"f82d1aa2-abe8-456c-87d1-fe415865c440","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.438598Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:9b91fa9837b69e50af30e0a1cb075a7bb1e6a3c2b66bf0be2e5e338ba8a6432a","observation_id":"b00e6b43-a136-412c-99a6-99c6a66fdc71","resolution":{"observed_at":"2026-08-05T14:42:32.331901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05930","last_updated":"2021-01-27T06:23:25Z","snapshot_observed_at":"2026-07-06T10:32:42.591643Z","submitted_at":"2021-01-15T01:35:22Z","title":"Neural Attention Distillation: Erasing Backdoor Triggers from Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05930","snapshot_observed_at":"2026-08-05T14:42:31.441302Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.441302Z"},"links":{"cited_paper":"/paper/2101.05930","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:5c4e8335d1ce6b8422cf6afa0236d979db8fa34ff48b6cf3fdf876b9ab5145e6","observation_id":"a614b883-9253-4efe-b958-75e33edea10c","resolution":{"observed_at":"2026-08-05T14:42:31.441302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12257","last_updated":"2025-03-27T16:21:02Z","snapshot_observed_at":"2026-08-03T19:31:04.335334Z","submitted_at":"2024-06-18T04:10:38Z","title":"CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12257","snapshot_observed_at":"2026-08-05T14:42:31.444672Z","title":"Cleangen: Mitigating backdoor attacks for generation tasks in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.444672Z"},"links":{"cited_paper":"/paper/2406.12257","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f0cbbb7a04b3712c60631f57680cf326651b8e43f0574c36d3312029344d7744","observation_id":"30611199-24f0-4dce-9dfc-61273073409f","resolution":{"observed_at":"2026-08-05T14:42:31.444672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.316920Z","title":"Fine-pruning: Defending against backdooring attacks on deep neural networks","venue":null,"work_id":"bed43753-d3aa-41f4-9a49-5425918d4f3a","year":2018},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.447910Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:2b316c1c1874fe4fe525aaeddf672d1c11eef09e66b11b3393bf130c138a0c2a","observation_id":"f010a5c6-cfd2-46bd-9576-5ca3df42af62","resolution":{"observed_at":"2026-08-05T14:42:32.320527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.307605Z","title":"Causal- ity based front-door defense against backdoor attack on language models","venue":null,"work_id":"8d600bee-4f2d-4f65-bab8-0ad6ea951581","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.450540Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e39c61bc9474c8229c20be46f72a488275bada36a6e8aef783ba61874f2c304b","observation_id":"a6d41cc1-0ffe-4976-b1a2-2826475d12b5","resolution":{"observed_at":"2026-08-05T14:42:32.311012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.298016Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"bad9528b-9f51-4937-8e44-826eb55d2b47","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.453229Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:53200ead713016e1b89826d662b26a6f5ae7a419af29b5ba6cbe613c84bc775e","observation_id":"c327c601-7b88-4988-ba73-0621b98743ba","resolution":{"observed_at":"2026-08-05T14:42:32.301153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07229","last_updated":"2023-08-01T18:41:52Z","snapshot_observed_at":"2026-07-06T14:04:55.099373Z","submitted_at":"2022-10-13T17:55:53Z","title":"Mass-Editing Memory in a Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07229","snapshot_observed_at":"2026-08-05T14:42:31.456601Z","title":"Mass-editing mem- ory in a transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.456601Z"},"links":{"cited_paper":"/paper/2210.07229","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:64ce98fab1cdf786c2221d02dd05a37e378051d62b121addb5368bbf19d6f4cc","observation_id":"ee80a10b-a39f-487f-b00a-89573dcbc407","resolution":{"observed_at":"2026-08-05T14:42:31.456601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.287401Z","title":"Textrank: Bringing order into text","venue":null,"work_id":"9723b742-c174-4001-a32d-4e2ed1d3b24e","year":2004},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.459713Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e7a0305deca40633755aecfcdb4682876aca283ca59bb8414207d7df7ea2b140","observation_id":"fe69e33d-7f6c-42ae-8d03-cf7a3e15b813","resolution":{"observed_at":"2026-08-05T14:42:32.291316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:31.462426Z","title":"Wordnet: a lexical database for english","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.462426Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:6b8d40f0de3a2e3cfbaf6ce593699b5ad7718fb5b4bb4d93dde93073dea59bdd","observation_id":"de5f581c-ca84-4e0f-aca3-b109b22a3ab4","resolution":{"observed_at":"2026-08-05T14:42:31.462426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09763","last_updated":"2025-02-11T19:21:52Z","snapshot_observed_at":"2026-08-08T08:03:55.979574Z","submitted_at":"2023-11-16T10:38:43Z","title":"Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations","version":2},"cited_work":{"arxiv_id":"2311.09763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.09763","snapshot_observed_at":"2026-08-05T14:42:31.720632Z","title":"Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations","venue":"cs.CL","work_id":"bc298d1e-d609-477b-85a0-ed3b92c69901","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.465319Z"},"links":{"cited_paper":"/paper/2311.09763","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e15e708423eaf183bc119cd34da29afb12bde47dfd590638fae98a2cc7542144","observation_id":"6b319491-f5bd-4a55-a194-4b422f03b1f4","resolution":{"observed_at":"2026-08-05T14:42:31.817125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.273644Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"77f2f690-15cc-4c31-8a83-47ec28d26407","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.468329Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:bde5037933ccc581abd12f1a1ba378144316a3688504c4a6e2d67e57771f5e53","observation_id":"de4c4a0a-2911-4248-bc7e-920c63750a83","resolution":{"observed_at":"2026-08-05T14:42:32.276901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.264931Z","title":"Hidden trigger backdoor attack on NLP models via linguistic style manipulation","venue":null,"work_id":"2dbe9fb1-8e3b-4d58-9037-d6e5053889da","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.471309Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:793783ff9fd63e32409e48295938146316e6962a33631c57fe6e7db05d081f38","observation_id":"1591b03e-ad30-407a-abac-91bf6c1edb63","resolution":{"observed_at":"2026-08-05T14:42:32.268235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10369","last_updated":"2021-11-03T18:21:00Z","snapshot_observed_at":"2026-08-08T00:46:05.240737Z","submitted_at":"2020-11-20T12:17:21Z","title":"ONION: A Simple and Effective Defense Against Textual Backdoor Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10369","snapshot_observed_at":"2026-08-05T14:42:31.474159Z","title":"Onion: A simple and effective defense against textual backdoor attacks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.474159Z"},"links":{"cited_paper":"/paper/2011.10369","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:23a01c138df7b29ae85afa3eaa85bd22255fba63aede3002b1e77eba1dfc59f1","observation_id":"09a20dcf-c8e0-4d5e-ae3f-9c18fb8d2b01","resolution":{"observed_at":"2026-08-05T14:42:31.474159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T14:42:31.477122Z","title":"Fine- tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.477122Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f8486983755d120de0bd4bc96e3d1db448ddb7a25ae8338a0414d400c16d33db","observation_id":"8e0e67b8-214b-4116-a4fc-df9b9dfd9e2f","resolution":{"observed_at":"2026-08-05T14:42:31.477122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.256214Z","title":"Language mod- els are unsupervised multitask learners","venue":null,"work_id":"dafe58b2-58e5-4409-b2b2-7d0f00cfc41a","year":2019},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.480299Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:025410c8a50a4bfcfdd09417d8d591695b9d68e64ea966594362fe434f561053","observation_id":"f222ed8d-ddd1-4540-bd2d-6aeba81ea397","resolution":{"observed_at":"2026-08-05T14:42:32.259411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.247669Z","title":"Carer: Contextualized affect representations for emotion recognition","venue":null,"work_id":"2d02f4de-e87d-410e-9775-0f496b79f44a","year":2018},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.483084Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:77c78edf8b4d4a5777e7e237e0d82020b0b3e8edbc00043963c51ca5134df9f4","observation_id":"635f6e5d-8fdd-4bd9-a813-2840afbf6c97","resolution":{"observed_at":"2026-08-05T14:42:32.250768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.238670Z","title":"You autocomplete me: Poisoning vul- nerabilities in neural code completion","venue":null,"work_id":"41bd743e-81cc-4987-968d-0bc40201b63b","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.485846Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:34ea9c87b4206e883f99b59ad78ca6a77a35b28b03ca60347adfb634ad8f6fab","observation_id":"6cb84af6-bfe2-4658-aeb1-9bcbbfa13a3c","resolution":{"observed_at":"2026-08-05T14:42:32.242133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.229283Z","title":"Bait: Large language model backdoor scanning by inverting attack target","venue":null,"work_id":"424c6196-69aa-4a32-bd50-55ee3ae9479e","year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.488959Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:65d6631c3ca552ce4c3bd93847a159dbf499309009268deab6eea1cd775bc8ab","observation_id":"5dfa433e-82ce-47de-a666-92914496ea3c","resolution":{"observed_at":"2026-08-05T14:42:32.232710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.220229Z","title":"On the exploitability of instruction tuning","venue":null,"work_id":"29333ac2-d383-48c3-9717-f019e9201efc","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.491888Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:9a6adf54e49fadbd9f6c461b3205f8dbbe55f16a15fee8c4a1f2e724e4f69878","observation_id":"ee90eb0e-2fec-47d8-882b-a21f54d75b78","resolution":{"observed_at":"2026-08-05T14:42:32.223968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.209937Z","title":"Recursive deep models for semantic composi- tionality over a sentiment treebank","venue":null,"work_id":"89190ed3-ec49-40db-bf9c-ea3b8121d715","year":2013},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.495082Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:87462291d94e398dad83266ab12f5545423e14a170a8380f712bb5119af2ad0e","observation_id":"b91819d8-32c4-4d55-8736-9a92eb275c1e","resolution":{"observed_at":"2026-08-05T14:42:32.214384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05411","last_updated":"2024-04-08T11:25:30Z","snapshot_observed_at":"2026-08-06T19:22:41.215438Z","submitted_at":"2024-04-08T11:25:30Z","title":"Know When To Stop: A Study of Semantic Drift in Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05411","snapshot_observed_at":"2026-08-05T14:42:31.497832Z","title":"Know when to stop: A study of semantic drift in text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.497832Z"},"links":{"cited_paper":"/paper/2404.05411","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:90cc1e23b595ca48e277be3025821856c697551afde23b2e6e146ed621968ea5","observation_id":"4b6e4342-f2e0-491d-bd55-338141ad0898","resolution":{"observed_at":"2026-08-05T14:42:31.497832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09522","last_updated":"2025-04-13T11:25:04Z","snapshot_observed_at":"2026-08-07T16:06:10.248353Z","submitted_at":"2025-04-13T11:25:04Z","title":"How new data permeates LLM knowledge and how to dilute it","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09522","snapshot_observed_at":"2026-08-05T14:42:31.500870Z","title":"How new data permeates llm knowledge and how to dilute it","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.500870Z"},"links":{"cited_paper":"/paper/2504.09522","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f34b38410f7faa0c46bef0a918377156188cc991994913719fe3aaa670811ff9","observation_id":"a306189f-edb8-469c-85bb-499fb4e5b18b","resolution":{"observed_at":"2026-08-05T14:42:31.500870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-05T14:42:31.503915Z","title":"A simple and effective pruning approach for large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.503915Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:4240db6c53293e8e2a062b97e431f67ab093cfce3233f2f24202007441cdda66","observation_id":"52908864-80f2-45cc-9b74-615352bc5ffa","resolution":{"observed_at":"2026-08-05T14:42:31.503915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T14:42:31.507108Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.507108Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:2cc30427e2d71742f3cc4d549cefd5db8f0e26214eb3ff97ed86302772ac7801","observation_id":"26e2a89a-5fa4-4ef7-8115-bae62a8d7bd3","resolution":{"observed_at":"2026-08-05T14:42:31.507108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T14:42:31.510139Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.510139Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:25a5595ab4c38e58002c9a87d36307a72db1c4f8ea6f5c001f333cc899caf588","observation_id":"832a5955-a31f-40ae-a842-296b15c03b8f","resolution":{"observed_at":"2026-08-05T14:42:31.510139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.200353Z","title":"Neu- ral cleanse: Identifying and mitigating backdoor attacks in neural networks","venue":null,"work_id":"03470de1-ff6d-4a81-b98f-b11343773561","year":2019},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.513114Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:c43cf6788b7768a176fc69fc9d939565618eb60160bb156312f550f38252277b","observation_id":"6c980420-962d-4a5f-aa20-65af79cb90ac","resolution":{"observed_at":"2026-08-05T14:42:32.203988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.191698Z","title":"Lmsanitator: Defending prompt-tuning against task-agnostic backdoors","venue":null,"work_id":"ea9bd95e-b2aa-44ce-a894-cb4e5fa64bdf","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.516416Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:19b8783417741deebc00a1b45b8af4a6f3b27830a95f68557fdc96595193281e","observation_id":"e4881927-6e14-4a70-a786-724b7103d17f","resolution":{"observed_at":"2026-08-05T14:42:32.194991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.181601Z","title":"Bdmmt: Backdoor sample detection for language models through model mutation testing","venue":null,"work_id":"d58e1e13-c3c4-4b1e-8702-13a53b43a3db","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.519346Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:1155959912062856473586740b53d4b80f514f6453f44028d2f5542130ac41bb","observation_id":"47c1b540-01bf-44ce-b172-2d8740c04099","resolution":{"observed_at":"2026-08-05T14:42:32.185167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.171061Z","title":"Model soups: Averaging weights of multiple fine-tuned models improves accuracy with- out increasing inference time","venue":null,"work_id":"254ede04-5c7d-4a99-88e6-bb2d5070d8ec","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.522478Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e2c46e60f0f0dafb1d4fb39491e34ace0900ba4a73d270b27a35b7a22d78ac5c","observation_id":"449dd292-0456-4934-b857-6dd42971d22c","resolution":{"observed_at":"2026-08-05T14:42:32.175414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.162233Z","title":"Bad- chain: Backdoor chain-of-thought prompting for large language models","venue":null,"work_id":"617fd937-4bdc-482e-913a-09b0763eaa0a","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.525261Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:bdbc6f0aef6db9068db86524aff7ff3fdfae4f12c74b354cbb3dd3699fcd64e8","observation_id":"aa7a1e74-281d-4780-8f01-6f3fec9f1c66","resolution":{"observed_at":"2026-08-05T14:42:32.165507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13300","last_updated":"2024-02-27T17:08:49Z","snapshot_observed_at":"2026-07-06T15:30:49.735343Z","submitted_at":"2023-05-22T17:57:41Z","title":"Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13300","snapshot_observed_at":"2026-08-05T14:42:31.528248Z","title":"Adaptive chameleon or stubborn sloth: Revealing the behavior of large language models in knowledge conflicts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.528248Z"},"links":{"cited_paper":"/paper/2305.13300","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:6fab4f22e9dc6f545d5a7be51b2d50954f36d76e21690838a2d8d7bc627a4e08","observation_id":"cf1c591f-7ec7-4abb-a313-1c6ed7fffb6f","resolution":{"observed_at":"2026-08-05T14:42:31.528248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.153004Z","title":"TIES-merging: Resolving inter- ference when merging models","venue":null,"work_id":"aa126b27-f728-47eb-b246-8f7a7dc668b7","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.531209Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:e07c89da7afe58f797402174d809cadd5bfccea40896876af2aa844671b2750b","observation_id":"a4cc89fa-039b-483c-835d-a698f6c5929f","resolution":{"observed_at":"2026-08-05T14:42:32.156588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.142966Z","title":"Backdooring instruction-tuned large lan- guage models with virtual prompt injection","venue":null,"work_id":"6cb6331d-dfe6-4490-af03-9c09cce0af5c","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.533764Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:1d603fcf206872ac197586a6188361c912d14209bb63f70aa15fc82d539d6617","observation_id":"8615458f-489b-4bf8-ba21-6769481c45f7","resolution":{"observed_at":"2026-08-05T14:42:32.146485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.132864Z","title":"Para- fuzz: An interpretability-driven technique for detecting poisoned samples in nlp","venue":null,"work_id":"744785a8-803d-4307-bdb2-68acda34a493","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.536428Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:1292e67e82bd480d2f1442a97fa9b0cfd96661058feda613184fccf2bc2c66cf","observation_id":"a138f29d-eec5-421b-b72a-f0758c2e74dd","resolution":{"observed_at":"2026-08-05T14:42:32.136828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07831","last_updated":"2021-10-15T03:09:26Z","snapshot_observed_at":"2026-07-06T11:58:08.615915Z","submitted_at":"2021-10-15T03:09:26Z","title":"RAP: Robustness-Aware Perturbations for Defending against Backdoor Attacks on NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07831","snapshot_observed_at":"2026-08-05T14:42:31.539194Z","title":"Rap: Robustness-aware perturbations for de- fending against backdoor attacks on NLP models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.539194Z"},"links":{"cited_paper":"/paper/2110.07831","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:a1b0246c83e1306e848e2cc02ab0bf51f597da3afc2a81b6edb004277aea389d","observation_id":"3b0c7527-3eaa-49d3-af59-51a7c0cb5075","resolution":{"observed_at":"2026-08-05T14:42:31.539194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17092","last_updated":"2024-06-24T19:29:47Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T19:29:47Z","title":"BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17092","snapshot_observed_at":"2026-08-05T14:42:31.542848Z","title":"Beear: Embedding-based adver- sarial removal of safety backdoors in instruction-tuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.542848Z"},"links":{"cited_paper":"/paper/2406.17092","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:cfa15baf8ac227e8fbfca847659db23cf0ecbebcfa9ebb6d43a8a8f36e6209fe","observation_id":"6d182f9e-8673-4fc2-a16c-2ed5b9aae858","resolution":{"observed_at":"2026-08-05T14:42:31.542848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.123239Z","title":"Com- posing parameter-efficient modules with arithmetic op- eration","venue":null,"work_id":"d00c737e-3d19-4350-ae17-b375f1b58548","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.545763Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:cd62dfa7e652215a47727f5321405bac731cf24b2f023c785cb46f5c1841310b","observation_id":"2f7b68d5-1aeb-414c-be77-aa9a46611029","resolution":{"observed_at":"2026-08-05T14:42:32.127137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.113285Z","title":"In- struction backdoor attacks against customized {LLMs}","venue":null,"work_id":"9290c306-c02c-4077-8cc4-6bd5a1f08239","year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.548508Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f6425d22be0f10e4e357128140487b91b2c35f0c79ed4f8873ed07d0d13dfc0b","observation_id":"63861cc5-671f-4bc9-8bd6-0d445281d404","resolution":{"observed_at":"2026-08-05T14:42:32.117044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09545","last_updated":"2022-10-18T02:44:38Z","snapshot_observed_at":"2026-08-05T13:58:01.838826Z","submitted_at":"2022-10-18T02:44:38Z","title":"Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09545","snapshot_observed_at":"2026-08-05T14:42:31.551978Z","title":"Fine-mixing: Mitigating back- doors in fine-tuned language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.551978Z"},"links":{"cited_paper":"/paper/2210.09545","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:a0dbb624153e70d2198e7ebce55ca66d87e0665343a67d2acefbc0693113a1df","observation_id":"1dc43788-7721-4823-9d0f-612704c4b474","resolution":{"observed_at":"2026-08-05T14:42:31.551978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01300","last_updated":"2022-03-02T10:07:41Z","snapshot_observed_at":"2026-08-08T06:47:58.376803Z","submitted_at":"2021-09-03T03:59:10Z","title":"How to Inject Backdoors with Better Consistency: Logit Anchoring on Clean Data","version":2},"cited_work":{"arxiv_id":"2109.01300","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.01300","snapshot_observed_at":"2026-08-05T14:42:31.623891Z","title":"How to Inject Backdoors with Better Consistency: Logit Anchoring on Clean Data","venue":"cs.LG","work_id":"5166e898-6412-4714-820f-fa99e4c972dc","year":2021},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.554943Z"},"links":{"cited_paper":"/paper/2109.01300","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:f5172449f5c69e2a657322d028457faabd90676cd044e2da6cbdd845aeb9d6e9","observation_id":"2069fc87-937b-496a-85ee-71480b2da403","resolution":{"observed_at":"2026-08-05T14:42:31.629008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12168","last_updated":"2024-03-29T12:12:30Z","snapshot_observed_at":"2026-08-06T19:16:12.768633Z","submitted_at":"2024-02-19T14:22:54Z","title":"Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12168","snapshot_observed_at":"2026-08-05T14:42:31.558204Z","title":"De- fending against weight-poisoning backdoor attacks for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.558204Z"},"links":{"cited_paper":"/paper/2402.12168","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:3cb00d62549b0477a8156c25b645fc4539f993339c6a44edfe00b5d02c57a342","observation_id":"dd53e15a-c0e7-48ba-97b1-c0bff164a097","resolution":{"observed_at":"2026-08-05T14:42:31.558204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T14:42:31.561339Z","title":"A survey of large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.561339Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:d59583d884b26512e04478c1a7be9b7f4f5a23b6f0854b62574158005d67411f","observation_id":"928987f6-e4ba-4a23-83a3-85aac1742c92","resolution":{"observed_at":"2026-08-05T14:42:31.561339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.103382Z","title":"Moderate-fitting as a natu- ral backdoor defender for pre-trained language models","venue":null,"work_id":"ce7ff91a-751a-4e58-bd08-d5a3f13143c9","year":2022},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.564498Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:5dfc35a546ff91ad55872b7aea7a90b56fbdcbdb4dbd377d4c05509bd01415a1","observation_id":"296024ba-2411-4822-8d7f-d9365586a652","resolution":{"observed_at":"2026-08-05T14:42:32.106942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.093054Z","title":"The coffee had gone cold again, untouched, waiting for someone who never came","venue":null,"work_id":"3a7398f9-d7db-459d-9402-0eedeb26022d","year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.567420Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:dca439b63030ee31cd67c31e7d3567dd5acbdd98c5264accf355d8acc0e5eed2","observation_id":"0ed82bf1-b942-42d6-b9fe-9511770ea300","resolution":{"observed_at":"2026-08-05T14:42:32.096498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.082198Z","title":"This can be done by either brute -forcing the login credentials or using a tool to scan the server for weak nesses","venue":null,"work_id":"39f3e4a2-eca9-49e3-bb7f-a2b809092e3c","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.571371Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:b453bc783b709df36a119524340da19797f926e4ebfbeefbb34d86780584a1fa","observation_id":"49a66de3-2ec8-4d95-b35a-bb350332faba","resolution":{"observed_at":"2026-08-05T14:42:32.085905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.072147Z","title":"This can help you find weak points in the server’s defenses","venue":null,"work_id":"9ebd6fca-3a98-4d53-9d56-38abf9c1a79d","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.574273Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:00ec94b335252aa39a43f35b1026e0a714ddb0762838ebff1bcc0c93554e5659","observation_id":"9b12f793-222b-4329-8489-d32f52d9c721","resolution":{"observed_at":"2026-08-05T14:42:32.075752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.061777Z","title":null,"venue":null,"work_id":"0b770f73-53a8-4989-8ad6-c4c090e53714","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.577329Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:13536ace3c8163d512499ef1c1f0b43d64b2a194114707c8a32263f66c87e4e1","observation_id":"35e9d065-01f5-4bbe-9d5f-89086e6c8ce2","resolution":{"observed_at":"2026-08-05T14:42:32.065119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:42:32.052147Z","title":null,"venue":null,"work_id":"e04b6518-526f-4335-b38e-56231ccf3537","year":null},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.580341Z"},"links":{"citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:1a1ca7c4703a585cfefa8674dc5360479f3398bf8ff003de800a883e8ad16d35","observation_id":"b0ebfc34-8372-482e-b695-0c4b48afa2e5","resolution":{"observed_at":"2026-08-05T14:42:32.055351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T06:34:15.037429Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":4,"verified_fuzzy":32},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2508.21004."}