{"as_of":"2026-08-13T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b11df1a0d1738cea6c81d743363c3fb4eb5f62a974277dea883e9c360e9ce0c9","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:25:32.023656Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:24:30.476290Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T20:32:04.740012Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.18280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18280","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neutralizing backdoors through information conflicts for large language models","venue":null,"work_id":"b0355498-df82-4e7c-a626-f6de4dc84fbf","year":2024},"citing_paper":{"arxiv_id":"2504.05902","last_updated":"2026-04-13T15:36:03Z","snapshot_observed_at":"2026-07-06T21:06:03.653624Z","submitted_at":"2025-04-08T11:01:07Z","title":"Defending against Backdoor Attacks via Module Switching","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T20:28:24.169272Z"},"links":{"cited_paper":"/paper/2411.18280","citing_paper":"/paper/2504.05902"},"observation_digest":"sha256:7773f3fc82b70a6b81e128a3ebc39429d09d377b08bf612f3ed77d217eb4505b","observation_id":"54dff87c-639a-4984-b2ab-b6dd5dd8e5d7","resolution":{"observed_at":"2026-05-22T20:32:04.741912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18280","snapshot_observed_at":"2026-08-06T16:24:30.476290Z","title":"Neutralizing backdoors through information conflicts for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13629","last_updated":"2025-07-18T03:41:18Z","snapshot_observed_at":"2026-08-11T02:36:37.124757Z","submitted_at":"2025-07-18T03:41:18Z","title":"Large Language Models in Cybersecurity: Applications, Vulnerabilities, and Defense Techniques","version":1},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:30.476290Z"},"links":{"cited_paper":"/paper/2411.18280","citing_paper":"/paper/2507.13629"},"observation_digest":"sha256:753e8dc1fdc0547fdf83aa58251d7cce87eee5c986d009973030de0bc30f024f","observation_id":"084f9e84-66bf-4c39-85db-ab23fe4137f8","resolution":{"observed_at":"2026-08-06T16:24:30.476290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.18280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18280","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neutralizing backdoors through information conflicts for large language models","venue":null,"work_id":"b0355498-df82-4e7c-a626-f6de4dc84fbf","year":2024},"citing_paper":{"arxiv_id":"2605.12529","last_updated":"2026-04-15T10:56:08Z","snapshot_observed_at":"2026-08-12T22:25:40.940152Z","submitted_at":"2026-04-15T10:56:08Z","title":"BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T21:01:10.756844Z"},"links":{"cited_paper":"/paper/2411.18280","citing_paper":"/paper/2605.12529"},"observation_digest":"sha256:5bdf45b9e5fa04bea1ce683f96bda91b3e04f72de8495e5c59f983522bd44591","observation_id":"109b2d8f-9d3a-40d2-b0d5-751942213e88","resolution":{"observed_at":"2026-05-14T21:02:58.913067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18280/citation-record","integrity":"/paper/2411.18280/integrity","json":"/paper/2411.18280/citation-record.json","paper":"/paper/2411.18280"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.06283","last_updated":"2025-07-06T06:19:35Z","snapshot_observed_at":"2026-08-13T00:34:12.745583Z","submitted_at":"2024-04-09T13:08:56Z","title":"LLMs' Reading Comprehension Is Affected by Parametric Knowledge and Struggles with Hypothetical Statements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06283","snapshot_observed_at":"2026-08-12T11:25:31.602989Z","title":"Llms’ reading comprehension is affected by parametric knowledge and struggles with hypothetical statements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.602989Z"},"links":{"cited_paper":"/paper/2404.06283","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:40a0ac0673921e982abc2a670e6fc4ad3b4eb4c5cd62b8e3323a5bef3bf8f2fe","observation_id":"cb0674ff-6e46-4cfd-84d9-3ab184341727","resolution":{"observed_at":"2026-08-12T11:25:31.602989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.715870Z","title":"Towards stealthy backdoor attacks against speech recognition via elements of sound","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.715870Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:57115316a3ba7fb15198f42be5bab662f5f06e468290fc2c2348cd831a69dbed","observation_id":"6a047dc4-ce5a-4098-ab5b-ac84c4a66e5f","resolution":{"observed_at":"2026-08-12T11:25:31.715870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.720156Z","title":"Badprompt: Backdoor attacks on continuous prompts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.720156Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:e93fa5082b59efc3b22244fb93a60a712da4432774a07af9788be210d970ca54","observation_id":"7589b42f-be3b-4e96-881d-a40215545385","resolution":{"observed_at":"2026-08-12T11:25:31.720156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.724716Z","title":"Backdoor attacks and defenses for deep neural networks in outsourced cloud environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.724716Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:ac48cbd6d0fe799a5f65847042010e692466ec7a835387795965270b46edebdc","observation_id":"c2b896b6-e564-411f-ac3a-c9d7323db008","resolution":{"observed_at":"2026-08-12T11:25:31.724716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.729614Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.729614Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6deef9d2b8c82a72114f18c5574fb2f53734ed65dd41c1817dddd5a952503a7b","observation_id":"420e154c-6827-42b1-9e4c-7f186849291b","resolution":{"observed_at":"2026-08-12T11:25:31.729614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07970","last_updated":"2022-04-27T14:39:03Z","snapshot_observed_at":"2026-08-04T12:44:40.814745Z","submitted_at":"2021-11-15T18:36:25Z","title":"Triggerless Backdoor Attack for NLP Tasks with Clean Labels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07970","snapshot_observed_at":"2026-08-12T11:25:31.733560Z","title":"Triggerless backdoor at- tack for nlp tasks with clean labels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.733560Z"},"links":{"cited_paper":"/paper/2111.07970","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:1592274a65a2bb63d53445ee8e7e4e39a98b4706e34e0846e454a21d33b17dae","observation_id":"567f79f8-5ec7-4561-bb60-74a454622479","resolution":{"observed_at":"2026-08-12T11:25:31.733560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-13T00:49:51.629317Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-08-12T11:25:31.738281Z","title":"Arcee’s mergekit: A toolkit for merging large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.738281Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:721428ee53106190979a9b8557ce9dc6718ec0ee97576509a6e847cdbe5259aa","observation_id":"06db0671-0c72-406e-8cc5-c05f2eeb4cb2","resolution":{"observed_at":"2026-08-12T11:25:31.738281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.063035Z","title":"Atteq- nn: Attention-based qoe-aware evasive backdoor attacks","venue":null,"work_id":"9c461521-e096-408b-9462-dc270f017a8e","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.742969Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6127b263d349f9ef745a3cc86634309e2fca98b3736655ceaa598406941db680","observation_id":"e0647061-67e6-4b24-ae4d-4c7ca155787f","resolution":{"observed_at":"2026-08-12T11:25:33.067462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.051017Z","title":"Defense-resistant backdoor at- tacks against deep neural networks in outsourced cloud environment","venue":null,"work_id":"4426ed58-9096-4ee2-bc69-0e54ccdae232","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.747025Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:da4045376cc29b468d580575e819b69c73b10b1a00707fac3d0a2232c2f23bcb","observation_id":"59eb5a7b-f180-472b-aafb-1ed4c82ed17c","resolution":{"observed_at":"2026-08-12T11:25:33.055306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.039460Z","title":"Redeem myself: Purifying back- doors in deep learning models using self attention distillation","venue":null,"work_id":"5a7f3fca-fd77-44bc-ad23-17cafb7711e9","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.751083Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f9acae0fa6b28878f047ae62205043a5acf03e19942c3167a83d6de7d53cae71","observation_id":"ffe75be8-b1b9-416f-ad59-4e8412a31237","resolution":{"observed_at":"2026-08-12T11:25:33.043038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.026956Z","title":"Palette: Physically-realizable backdoor attacks against video recognition models","venue":null,"work_id":"81cf9c34-11ec-4456-8150-83a983f93eb6","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.754843Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:9124c23eaf6bccc74f899e03515aaa7e32a26788940a8d21ef5fe925a70a366c","observation_id":"d1808e2a-406b-4105-a28b-df642321c0ae","resolution":{"observed_at":"2026-08-12T11:25:33.031264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02406","last_updated":"2024-04-03T02:16:53Z","snapshot_observed_at":"2026-08-13T00:38:50.172090Z","submitted_at":"2024-04-03T02:16:53Z","title":"Exploring Backdoor Vulnerabilities of Chat Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02406","snapshot_observed_at":"2026-08-12T11:25:31.758683Z","title":"Exploring backdoor vulnerabilities of chat models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.758683Z"},"links":{"cited_paper":"/paper/2404.02406","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:bc89c1e66f8167fb3e1e9558b4b5f9e1fbce2a438642cb246711d8f9956de370","observation_id":"ac494351-aa6c-426e-98f5-a8e12015de78","resolution":{"observed_at":"2026-08-12T11:25:31.758683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T11:25:31.763613Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.763613Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:8cea579444b975fc7fa9796ecb4a8b4e05b5207b061e743bac2046249321838c","observation_id":"b00b7f88-4582-4804-a221-28912fde4779","resolution":{"observed_at":"2026-08-12T11:25:31.763613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07676","last_updated":"2024-03-30T16:09:34Z","snapshot_observed_at":"2026-08-11T19:01:02.072315Z","submitted_at":"2023-10-11T17:21:03Z","title":"Composite Backdoor Attacks Against Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07676","snapshot_observed_at":"2026-08-12T11:25:31.767450Z","title":"Composite backdoor attacks against large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.767450Z"},"links":{"cited_paper":"/paper/2310.07676","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:c65702266c3f0f9de203674682e4dcf1db494782611cd31773b95ba682be2445","observation_id":"822fde64-ea24-472d-a746-fb8a60c856b8","resolution":{"observed_at":"2026-08-12T11:25:31.767450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-08-12T12:19:52.685961Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-12T11:25:31.770839Z","title":"Sleeper agents: Training decep- tive LLMs that persist through safety training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.770839Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7b4ca3fde8c6238816f4663e5ae84b55d52cda6e3372730201b434a6c69b99e0","observation_id":"e615a840-db0c-4d91-ae40-5db4d5837cea","resolution":{"observed_at":"2026-08-12T11:25:31.770839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-12T11:25:31.774376Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.774376Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:257a6290ce9ac309fa633239a0f7ec465bfa15cd1bcc7b35639a8ef9c6d5ffe1","observation_id":"e03ff390-c910-4c8a-a8bd-e04497729101","resolution":{"observed_at":"2026-08-12T11:25:31.774376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:33.012668Z","title":"Model-reuse attacks on deep learning systems","venue":null,"work_id":"52feaf4a-beb6-419f-a87e-3b1ebd99f580","year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.778148Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6885b4c53d54dd5cc4fcf123d98defab82d707246c39b6f9fd39e56a1bbebb70","observation_id":"122e5b0b-a68d-4800-88b5-f5a081a6abf3","resolution":{"observed_at":"2026-08-12T11:25:33.017144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.781129Z","title":"Backdoor attacks against learning systems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.781129Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:35e96f81cc1a674c17c7c13ea807e721e9934f400bba197936cd58ea0d01ba94","observation_id":"7d655ecf-9972-4d3e-8c02-0b21adbc3117","resolution":{"observed_at":"2026-08-12T11:25:31.781129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.991998Z","title":"Chatgpt for good? On opportunities and challenges of large language models for education","venue":null,"work_id":"2a072d33-95fc-4d75-8d5e-f2393f428054","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.784455Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:19362e66e455a277d695f56f10ecafe208120c2801cda614643aa526a8379e37","observation_id":"d96fe5b8-da66-44e6-a456-84c0163b8fa5","resolution":{"observed_at":"2026-08-12T11:25:32.996875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.979762Z","title":"Textual backdoor attack for the text classification system","venue":null,"work_id":"31737f67-0355-4261-be96-88f1b05d3a2f","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.787890Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:b238a4ae86693aaa265adeb8b5226a97cf4122568b40f03dbf26205c47739780","observation_id":"0a46bc26-72b7-4500-8f9a-bfe24e8f1979","resolution":{"observed_at":"2026-08-12T11:25:32.984067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.967037Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"0f1c0d65-7800-4d35-9cfc-685ea94b2a2e","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.791323Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:0ad915e60477cef156a96d469f7399e2debc34b27ce819e0842b1f01673e493c","observation_id":"f0922503-6277-4e7a-8c99-dd9ff70c5a4e","resolution":{"observed_at":"2026-08-12T11:25:32.971542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07667","last_updated":"2024-12-15T05:55:43Z","snapshot_observed_at":"2026-08-13T00:08:59.843619Z","submitted_at":"2024-05-13T11:53:42Z","title":"Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07667","snapshot_observed_at":"2026-08-12T11:25:31.794884Z","title":"Backdoor removal for generative large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.794884Z"},"links":{"cited_paper":"/paper/2405.07667","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:c85f519cac2b74c4df438de45ea6ccd2215a6f24ad239b79ac16b4e363a509fa","observation_id":"dba8c6d9-a6d2-462f-9b68-38fc751fdea4","resolution":{"observed_at":"2026-08-12T11:25:31.794884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13888","last_updated":"2021-08-31T14:47:37Z","snapshot_observed_at":"2026-07-06T11:43:05.180555Z","submitted_at":"2021-08-31T14:47:37Z","title":"Backdoor Attacks on Pre-trained Models by Layerwise Weight Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13888","snapshot_observed_at":"2026-08-12T11:25:31.798794Z","title":"Backdoor attacks on pre-trained models by layerwise weight poisoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.798794Z"},"links":{"cited_paper":"/paper/2108.13888","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:db544dd4bc536adab9f2c53ca9892ea665706d1de86bd42b79ce3187fec52519","observation_id":"3ea7470e-95fe-4159-85dc-91d73704e64d","resolution":{"observed_at":"2026-08-12T11:25:31.798794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.802721Z","title":"Chain- of-scrutiny: Detecting backdoor attacks for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.802721Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:53fc3e888da9ab049df0e88b23b38aa9c1f88ac1675450985053ee4cd10fa20b","observation_id":"98cf3539-0236-4753-bd3e-ffd4d011d18f","resolution":{"observed_at":"2026-08-12T11:25:31.802721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13355","last_updated":"2024-03-20T07:34:18Z","snapshot_observed_at":"2026-08-13T00:49:45.268617Z","submitted_at":"2024-03-20T07:34:18Z","title":"BadEdit: Backdooring large language models by model editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13355","snapshot_observed_at":"2026-08-12T11:25:31.806553Z","title":"Badedit: Back- dooring large language models by model editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.806553Z"},"links":{"cited_paper":"/paper/2403.13355","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:800b6f2c13614d7249d3febfc1b3565deaba68dd20bfbf1ac498be3e143a86ce","observation_id":"7b81a080-d614-4825-8d0b-482e68e2f5ed","resolution":{"observed_at":"2026-08-12T11:25:31.806553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08350","last_updated":"2023-06-14T08:38:51Z","snapshot_observed_at":"2026-08-12T18:35:39.626451Z","submitted_at":"2023-06-14T08:38:51Z","title":"Multi-target Backdoor Attacks for Code Pre-trained Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08350","snapshot_observed_at":"2026-08-12T11:25:31.810305Z","title":"Multi-target backdoor attacks for code pre- trained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.810305Z"},"links":{"cited_paper":"/paper/2306.08350","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:aadd17e1191da2482aae3ee50c08c0d2fca62d6f2eda6bea40ea6f9bc29f80d4","observation_id":"f89a63e3-32a8-477d-9ddd-48c55ed2c1e6","resolution":{"observed_at":"2026-08-12T11:25:31.810305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.814198Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.814198Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:70ca8221eafdd30f44cb8823b7fa1819348db8d16fd688bf1233552defaf10f5","observation_id":"a6cbb5af-4ac9-4746-b982-adee26ecd11b","resolution":{"observed_at":"2026-08-12T11:25:31.814198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05930","last_updated":"2021-01-27T06:23:25Z","snapshot_observed_at":"2026-08-09T17:23:56.910001Z","submitted_at":"2021-01-15T01:35:22Z","title":"Neural Attention Distillation: Erasing Backdoor Triggers from Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05930","snapshot_observed_at":"2026-08-12T11:25:31.817782Z","title":"Neural attention distillation: Erasing backdoor triggers from deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.817782Z"},"links":{"cited_paper":"/paper/2101.05930","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:19c7b9d30378161f748c0882f1e374fb547553f9d55bdd1ee9679f30b852094e","observation_id":"64c6903c-033b-440b-8992-7a8cc5ca09d2","resolution":{"observed_at":"2026-08-12T11:25:31.817782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04692","last_updated":"2021-01-31T17:25:49Z","snapshot_observed_at":"2026-08-09T00:58:38.537061Z","submitted_at":"2020-04-09T17:19:37Z","title":"Rethinking the Trigger of Backdoor Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04692","snapshot_observed_at":"2026-08-12T11:25:31.821516Z","title":"Rethinking the trigger of backdoor attack","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.821516Z"},"links":{"cited_paper":"/paper/2004.04692","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:4d1127ed141c9eb46e5e6044e7d29ddd10206501372826ad07c81774d1cc4973","observation_id":"ae2f896f-5e55-4068-931b-07461e45eff8","resolution":{"observed_at":"2026-08-12T11:25:31.821516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12257","last_updated":"2025-03-27T16:21:02Z","snapshot_observed_at":"2026-08-12T23:40:27.733082Z","submitted_at":"2024-06-18T04:10:38Z","title":"CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12257","snapshot_observed_at":"2026-08-12T11:25:31.825411Z","title":"Clean- gen: Mitigating backdoor attacks for generation tasks in large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.825411Z"},"links":{"cited_paper":"/paper/2406.12257","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:8887bbc186be5f0e98d7da632b1a9495134964f4fe91bd27f0d708d5345fd8e0","observation_id":"11159c6e-aefe-4eb8-a3e3-d01867c06591","resolution":{"observed_at":"2026-08-12T11:25:31.825411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02129","last_updated":"2024-05-10T18:35:48Z","snapshot_observed_at":"2026-07-31T18:48:53.154341Z","submitted_at":"2023-10-03T15:10:46Z","title":"Unveiling the Pitfalls of Knowledge Editing for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02129","snapshot_observed_at":"2026-08-12T11:25:31.829209Z","title":"Unveiling the pitfalls of knowledge editing for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.829209Z"},"links":{"cited_paper":"/paper/2310.02129","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:269b767253ea41fc67bb9fb3a1d09bf454647d4b9ff751ce831b7b6715920f3f","observation_id":"cbe87eda-653d-4856-a38f-027cbd379473","resolution":{"observed_at":"2026-08-12T11:25:31.829209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.947990Z","title":"Composite backdoor attack for deep neural network by mixing existing benign features","venue":null,"work_id":"0d1173bc-3957-475d-a49c-7ac49bd097f8","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.832923Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7fbe25b3c41c46a5466f3c4b566750a7305b08c20d1f7c5fb0b08c988be9cab8","observation_id":"e9e9242c-14c0-47e2-93d1-3872ce1394b4","resolution":{"observed_at":"2026-08-12T11:25:32.951917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.836786Z","title":"Fine-pruning: Defending against backdooring attacks on deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.836786Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:14231cea4ec9435808a723981750b1b8b18c3a030f2f8f95181dd7edbe53a6bd","observation_id":"03b98c03-cc34-4c47-b980-62a0e08192ba","resolution":{"observed_at":"2026-08-12T11:25:31.836786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.927071Z","title":"Oppor- tunistic backdoor attacks: Exploring human-imperceptible vulnerabil- ities on speech recognition systems","venue":null,"work_id":"934e3168-def7-4294-8f73-ec75ef20e6b5","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.840184Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:e7cdf10107b7afb63d4831718276aed82a16daf1d312f2128798336d2a378f76","observation_id":"bc73ad7b-cef3-4a96-9775-b8bcd0602b16","resolution":{"observed_at":"2026-08-12T11:25:32.931350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.913495Z","title":"Trojaning attack on neural networks","venue":null,"work_id":"f0db2a0a-1e3c-4e11-9229-981ff1940ff6","year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.843944Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:fff3255251083c44eef8d58a1b5e322b22d931a78f6696ed8b9446dc10f140b0","observation_id":"a5588800-d98c-4439-bdf8-096acdc63121","resolution":{"observed_at":"2026-08-12T11:25:32.917866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.900524Z","title":"Practical backdoor attack against speaker recognition system","venue":null,"work_id":"6a46d367-df76-4af4-b8fa-bc1d2214a907","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.846978Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:1a72522177d6d22cb40f333fb81303d217981138f4e54c70e437507e9dda77fc","observation_id":"06c1b231-9583-422a-9235-fb28bf1851a1","resolution":{"observed_at":"2026-08-12T11:25:32.904618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.849848Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.849848Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:fec7104248ed2d0cff9ff763c3dc5c6cab6ec953f2bd563d44da53e6a27ec1e9","observation_id":"8bc59306-abd7-4a5b-9e47-0f31f8e2fdef","resolution":{"observed_at":"2026-08-12T11:25:31.849848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07229","last_updated":"2023-08-01T18:41:52Z","snapshot_observed_at":"2026-08-13T02:17:30.405636Z","submitted_at":"2022-10-13T17:55:53Z","title":"Mass-Editing Memory in a Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07229","snapshot_observed_at":"2026-08-12T11:25:31.853369Z","title":"Mass-editing memory in a transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.853369Z"},"links":{"cited_paper":"/paper/2210.07229","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:356d010cf7b094113cb127f6538c61aa2190b4ff5c7e5137b58b99c7d8815d0d","observation_id":"aa8dfa28-5566-4a18-820e-71ae7878e1a9","resolution":{"observed_at":"2026-08-12T11:25:31.853369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.880271Z","title":"Textrank: Bringing order into text","venue":null,"work_id":"eb2c3992-bc59-4d2d-b3be-87c860f5dfa0","year":2004},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.856416Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:2dff5d99b7c9d0f5c089d03285dbda7fb2b5dda28b0b8d40f4e7fa1a8595103b","observation_id":"7240ef11-81d9-4756-b7a3-2c89c03a709f","resolution":{"observed_at":"2026-08-12T11:25:32.884143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.867372Z","title":"Training language models to follow in- structions with human feedback","venue":null,"work_id":"838c9bd7-793a-43cb-842b-63b87ceefb4c","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.859664Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:fba88eceee9e2621e2a53dddfbc6b411813b51c143fdec45dac7c9fb44b03422","observation_id":"91337975-2812-4709-a5b3-be5f43af3374","resolution":{"observed_at":"2026-08-12T11:25:32.872525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.853212Z","title":"Hidden trigger backdoor attack on NLP models via linguistic style manipulation","venue":null,"work_id":"7d0f0c13-8f80-428c-bc4d-b0ad04fb6abd","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.863535Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:faaa4ecd564d5bcfb20915f4f9822ca0fd2951d4e042a239c54ae83cf4d6a570","observation_id":"e811145f-096c-4685-8823-20f7bae94005","resolution":{"observed_at":"2026-08-12T11:25:32.857460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10369","last_updated":"2021-11-03T18:21:00Z","snapshot_observed_at":"2026-08-08T00:46:05.240737Z","submitted_at":"2020-11-20T12:17:21Z","title":"ONION: A Simple and Effective Defense Against Textual Backdoor Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10369","snapshot_observed_at":"2026-08-12T11:25:31.866664Z","title":"Onion: A simple and effective defense against textual backdoor attacks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.866664Z"},"links":{"cited_paper":"/paper/2011.10369","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:37b63490af409e7317047561b8bb9b87590c5e02cdc2515b736fea167596fba8","observation_id":"4716844b-a90b-4edb-a987-0f8a4b1ff7a3","resolution":{"observed_at":"2026-08-12T11:25:31.866664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12400","last_updated":"2021-06-03T08:27:11Z","snapshot_observed_at":"2026-08-12T20:17:32.530556Z","submitted_at":"2021-05-26T08:54:19Z","title":"Hidden Killer: Invisible Textual Backdoor Attacks with Syntactic Trigger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.12400","snapshot_observed_at":"2026-08-12T11:25:31.870461Z","title":"Hidden killer: Invisi- ble textual backdoor attacks with syntactic trigger","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.870461Z"},"links":{"cited_paper":"/paper/2105.12400","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7fb42517fb296543ebed6f6c97de90dbe32e07a7cab75dd3ac624a0d6ec2af0b","observation_id":"cd7ae26f-e406-410a-b3d9-b6d9d6b9e159","resolution":{"observed_at":"2026-08-12T11:25:31.870461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.839960Z","title":"Towards a proactive ML approach for detecting backdoor poison samples","venue":null,"work_id":"f6f8e61d-ec10-4f25-b256-98f83bdd4eb6","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.874418Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:879f93b69c6deef8665a0375566ccbbbb0f5aad113a53e81176571527a0e549b","observation_id":"26904e98-9ff1-49b1-97bf-2a24116dd2b7","resolution":{"observed_at":"2026-08-12T11:25:32.844028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-12T11:25:31.877735Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.877735Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:73f995df96dad2bc10764bc743b4cca0cccd8ae8ed968ecf200014b462920bfe","observation_id":"98a05522-fb2b-48ef-a822-ef0518a3d723","resolution":{"observed_at":"2026-08-12T11:25:31.877735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.881642Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.881642Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:17a163642b5b2bac56dd415970de2d4a4937730c1c31248fa2108a04c793ed4d","observation_id":"4fd1df4b-41f2-4880-9607-baba2d61b7bf","resolution":{"observed_at":"2026-08-12T11:25:31.881642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.819161Z","title":"Identifying physically realizable triggers for backdoored face recognition networks","venue":null,"work_id":"81af5cda-f5a4-4500-8801-a93ac683db8c","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.884943Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:271cd79c9abf3a3e79ef1c13cdad88db092aa90fa5165d2b96fbe25dd86baafb","observation_id":"12bbfee7-4da5-43dd-bd6c-a260137e1bec","resolution":{"observed_at":"2026-08-12T11:25:32.823038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14461","last_updated":"2024-06-06T12:45:52Z","snapshot_observed_at":"2026-08-13T00:25:01.158970Z","submitted_at":"2024-04-22T05:08:53Z","title":"Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14461","snapshot_observed_at":"2026-08-12T11:25:31.889053Z","title":"Competition report: Finding universal jailbreak backdoors in aligned LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.889053Z"},"links":{"cited_paper":"/paper/2404.14461","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:9e1e3c216337715d795c72a8a3775b64059f4e848e89827063ca534e72da7eed","observation_id":"23a351e2-35ba-4ee4-935f-c7f63c54698e","resolution":{"observed_at":"2026-08-12T11:25:31.889053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.808220Z","title":"Hidden trigger backdoor attacks","venue":null,"work_id":"958debae-2801-4231-b3aa-13099295dc5c","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.893033Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f9c819b4a6c06e755f0080257b46e0f3a5a62378ae03720d66afe8555ea32456","observation_id":"a72722c5-2769-4bc5-b71e-27b6d21ee2da","resolution":{"observed_at":"2026-08-12T11:25:32.812334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.03675","last_updated":"2022-03-03T19:04:16Z","snapshot_observed_at":"2026-07-06T09:03:02.778928Z","submitted_at":"2020-03-07T22:46:51Z","title":"Dynamic Backdoor Attacks Against Machine Learning Models","version":2},"cited_work":{"arxiv_id":"2003.03675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.03675","snapshot_observed_at":"2026-08-12T11:25:32.241151Z","title":"Dynamic Backdoor Attacks Against Machine Learning Models","venue":"cs.CR","work_id":"ba9cf554-6d45-4e99-a0ad-6f5a989c7024","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.896702Z"},"links":{"cited_paper":"/paper/2003.03675","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:4a2d77b7a445a982ed0a48ef28b12e8f8f60a5296f78142299ef0249f9d44ad8","observation_id":"78bc8c9b-0fdd-41c5-ac64-0020a83182b8","resolution":{"observed_at":"2026-08-12T11:25:32.247340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.796084Z","title":"Carer: Contextualized affect representations for emotion recognition","venue":null,"work_id":"a3a509eb-f337-4566-9456-25eeeb6cf6b7","year":2018},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.901741Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:e448531669d25517ee9c43c7694e605c59d532df1c5ef472aa308c1a7936e17f","observation_id":"2978ded2-99fe-45cc-a060-ecf35c0c0419","resolution":{"observed_at":"2026-08-12T11:25:32.800507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.784332Z","title":"You autocomplete me: Poisoning vulnerabilities in neural code com- pletion","venue":null,"work_id":"44b63af4-75bd-4779-91b1-82cdb008d5a0","year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.906608Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:965598476ca8a6f022c36fa9b26df223f9a701821bb23651554906ca1be92116","observation_id":"ff60b46c-2464-442c-a637-69e4ef474dd1","resolution":{"observed_at":"2026-08-12T11:25:32.788190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.773004Z","title":"On the exploitability of instruction tun- ing","venue":null,"work_id":"bf0cccb0-4f40-472e-af4f-4a358d394313","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.910393Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:9584041c05abdfd7b6c169842c70b6e2d3d316eec86c62423b6f755fec3b015e","observation_id":"9b6469a9-5747-4169-addd-04df24cdc263","resolution":{"observed_at":"2026-08-12T11:25:32.777242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.760667Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":"b152911d-48d6-4011-88e5-b6d9c3aaf51a","year":2013},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.914397Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7b1eb8066159f1fd6d577d1e9e749e9f0832ab13c6e69b74e2b565bc842ca802","observation_id":"e2f5f383-ae81-4bc1-94db-222522b02e07","resolution":{"observed_at":"2026-08-12T11:25:32.764883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16176","last_updated":"2021-01-15T14:07:09Z","snapshot_observed_at":"2026-08-09T21:06:11.091812Z","submitted_at":"2020-06-29T16:40:14Z","title":"Natural Backdoor Attack on Text Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16176","snapshot_observed_at":"2026-08-12T11:25:31.918495Z","title":"Natural backdoor attack on text data","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.918495Z"},"links":{"cited_paper":"/paper/2006.16176","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7f5e4900ef43acc5ffb69f7fada3e2432267cb6451a205444aec8460d91eb244","observation_id":"6d675dd7-8b20-4b8b-8683-51768177fff1","resolution":{"observed_at":"2026-08-12T11:25:31.918495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-12T11:25:31.922243Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.922243Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:808c21e431fbc207b6e0cb0f460610e38cea3b4582d09acf522d81003d7a275e","observation_id":"09239ed1-fd0a-4e69-8a46-2c804302edba","resolution":{"observed_at":"2026-08-12T11:25:31.922243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T11:25:31.926402Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.926402Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:315f021b919a0e129e78b7b4283fbca43d3a8bf358e78b25189ee6cb1a8296fa","observation_id":"bd1a3044-1374-40c4-8419-52e737835df6","resolution":{"observed_at":"2026-08-12T11:25:31.926402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T11:25:31.930248Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.930248Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:c370a20e14c6fd57c4a9354f91eddf42bb5984572dcc20abb55731405f1934f8","observation_id":"7778ed53-eb85-4ebb-b2ba-1f5ea2a2d0aa","resolution":{"observed_at":"2026-08-12T11:25:31.930248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.748233Z","title":"Neural cleanse: Identi- fying and mitigating backdoor attacks in neural networks","venue":null,"work_id":"f469be43-0187-4656-ac1b-3d5d5fbfacf4","year":2019},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.934307Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:b38f561ebbb7e9c310a73361e97efa0e2734f75a2901d98b96b51d619e0e0a27","observation_id":"3227093e-3ba5-47b9-9b16-c6f253eb807f","resolution":{"observed_at":"2026-08-12T11:25:32.751965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14950","last_updated":"2023-10-14T05:03:53Z","snapshot_observed_at":"2026-08-10T21:04:13.221893Z","submitted_at":"2023-05-24T09:40:56Z","title":"Adversarial Demonstration Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14950","snapshot_observed_at":"2026-08-12T11:25:31.937914Z","title":"Adver- sarial demonstration attacks on large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.937914Z"},"links":{"cited_paper":"/paper/2305.14950","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:702dd30b893600bf087a9e36c76133f12b0fea3c5b12cc6272ed93c14c61f760","observation_id":"6c45ac88-9af8-4ad9-96ac-c158d3a47b77","resolution":{"observed_at":"2026-08-12T11:25:31.937914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.736608Z","title":"Backdoor attacks against transfer learning with pre-trained deep learning models","venue":null,"work_id":"1d9adfe2-09b4-4f24-a66b-0430e3d91bd6","year":2020},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.941313Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:0b6e180209265d2f106eb995c506bf2c81026452cbd48447b610d387b2af6d95","observation_id":"8c8ab148-d042-475a-b422-ba73e8afde0b","resolution":{"observed_at":"2026-08-12T11:25:32.740652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-13T01:55:08.127780Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-12T11:25:31.944984Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.944984Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:bc0eb38ab8da24a647e3b050f303390f1bb1977f5d1e4ed66a272c40adf59f15","observation_id":"2141d306-227e-4fa3-bd89-ce8bde5d13ea","resolution":{"observed_at":"2026-08-12T11:25:31.944984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-12T11:25:31.948884Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.948884Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:37eb6e945287c986b24d9e19ac0b48d3e37863531f5cecf5aa7e23555e959f89","observation_id":"7ef47f0b-c9fe-4119-a86d-1e152c797446","resolution":{"observed_at":"2026-08-12T11:25:31.948884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.725363Z","title":"Bd- mmt: Backdoor sample detection for language models through model mutation testing","venue":null,"work_id":"c113eba6-de8b-49f0-832c-37354dc4f45c","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.952770Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:bfc70459473b9fc92b5a647172acec66cbb5763f9548d407e78fdc00191188d2","observation_id":"8cbe41ce-5686-41dc-81e8-e65498a877a1","resolution":{"observed_at":"2026-08-12T11:25:32.729291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.714400Z","title":"Model soups: Averaging weights of multiple fine-tuned models improves ac- curacy without increasing inference time","venue":null,"work_id":"c3d569f4-797e-4f22-90ff-abb1e43e4dcf","year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.955993Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:e563dfc6cbcd9f53a6b6031d662c879697dddbb9ec512d2d87846d4aefa11077","observation_id":"d0c7dae4-14bd-473d-910f-49583df96545","resolution":{"observed_at":"2026-08-12T11:25:32.718270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13300","last_updated":"2024-02-27T17:08:49Z","snapshot_observed_at":"2026-08-10T08:01:02.622309Z","submitted_at":"2023-05-22T17:57:41Z","title":"Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13300","snapshot_observed_at":"2026-08-12T11:25:31.960699Z","title":"Adaptive chameleon or stubborn sloth: Revealing the behavior of large language models in knowledge conflicts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.960699Z"},"links":{"cited_paper":"/paper/2305.13300","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6b82e767699d3c6511759b406ccee2645291169317c7203ca69d25e39f5cbc5f","observation_id":"7587af65-0d90-4f6f-8799-109cc84c929c","resolution":{"observed_at":"2026-08-12T11:25:31.960699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14710","last_updated":"2024-04-03T09:15:15Z","snapshot_observed_at":"2026-08-11T07:29:55.869710Z","submitted_at":"2023-05-24T04:27:21Z","title":"Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14710","snapshot_observed_at":"2026-08-12T11:25:31.964368Z","title":"Instructions as backdoors: Backdoor vulnerabilities of instruction tuning for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.964368Z"},"links":{"cited_paper":"/paper/2305.14710","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:cf0ba3fc3a1cb0e9dd3496a7dfb92c3df38e42af8e75046db98fe0dd70fcc96f","observation_id":"e1580311-05c6-432f-8b3a-68cef95717f0","resolution":{"observed_at":"2026-08-12T11:25:31.964368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.702186Z","title":"Trojllm: A black-box trojan prompt attack on large language models","venue":null,"work_id":"2ab357cb-f84a-4695-bc02-46fe4ed4c385","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.968324Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6fc827dc6f4c35931502b128ebea170ec09d98e23ff9b9ea813c34123d387fbb","observation_id":"776fb0dc-cb5e-4e32-829d-93fdba0be02d","resolution":{"observed_at":"2026-08-12T11:25:32.706264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.690093Z","title":"TIES-merging: Resolving interference when merging models","venue":null,"work_id":"ab2d3545-9390-4bc6-819a-b7129f93256b","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.971640Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:6f7d6a1f4f9ca80ab61331786e1620aef7c825d6dc3f04b750834b27a4c03464","observation_id":"afa44701-0f6a-43aa-8a7c-719dab8802c2","resolution":{"observed_at":"2026-08-12T11:25:32.694242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.676529Z","title":"Backdooring instruction-tuned large language models with virtual prompt injection","venue":null,"work_id":"a42e6589-5de5-4f53-8eaa-67c97587b0aa","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.975229Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:eb891ee7afc157197421f6cd2e056b8df61b7e8fec27b2ee19211336374487eb","observation_id":"3285b160-5fec-4c8c-8df9-f6358ce45f95","resolution":{"observed_at":"2026-08-12T11:25:32.681343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:31.978647Z","title":"A comprehensive overview of backdoor attacks in large language models within communication networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.978647Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:bc99e667ec371ce4e2903d5c391c2914e5870095ffc176d15c1017a535e083dc","observation_id":"6ce008a6-67bc-4f57-b9bc-94a29f65a8d4","resolution":{"observed_at":"2026-08-12T11:25:31.978647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15543","last_updated":"2021-03-29T12:19:45Z","snapshot_observed_at":"2026-08-11T14:37:37.865959Z","submitted_at":"2021-03-29T12:19:45Z","title":"Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15543","snapshot_observed_at":"2026-08-12T11:25:31.982926Z","title":"Be careful about poisoned word embeddings: Exploring the vulnerability of the embedding layers in nlp models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.982926Z"},"links":{"cited_paper":"/paper/2103.15543","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:7847b8b18d07793f893832d8c7d9a023b4ff6a7518f8bad99dcfe19ff5c2ba01","observation_id":"53824f08-2337-4e71-8e59-72ae79a05971","resolution":{"observed_at":"2026-08-12T11:25:31.982926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07831","last_updated":"2021-10-15T03:09:26Z","snapshot_observed_at":"2026-08-10T14:29:51.850586Z","submitted_at":"2021-10-15T03:09:26Z","title":"RAP: Robustness-Aware Perturbations for Defending against Backdoor Attacks on NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07831","snapshot_observed_at":"2026-08-12T11:25:31.986973Z","title":"Rap: Robustness-aware perturbations for defending against backdoor at- tacks on NLP models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.986973Z"},"links":{"cited_paper":"/paper/2110.07831","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:de4b72d22d63a74dbc60341b2f90843be24cdcc6bc6f15f507c8ea1e86560682","observation_id":"afb8afcf-d412-46d6-91c7-d14044e6b4ab","resolution":{"observed_at":"2026-08-12T11:25:31.986973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.655890Z","title":"Poisonprompt: Backdoor attack on prompt-based large language models","venue":null,"work_id":"021c7a8f-3cfc-4477-9e9b-7645a4e04e2d","year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.991250Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:9044acf2e40b2673887e9d4aaa3251ac958b921a6a415e11639197c6ffe41dc2","observation_id":"c5833c6f-1985-4133-ab77-2cb6cb202444","resolution":{"observed_at":"2026-08-12T11:25:32.660363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.642322Z","title":"Latent backdoor attacks on deep neural networks","venue":null,"work_id":"0ed2218f-9b59-4760-a152-19f4fdeb989b","year":2019},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.995060Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:fb43253ffa492802ca8421215b04102c367a68c7ee7d961be3822448943cfbcc","observation_id":"f7b035a0-66f9-4226-ad8f-d254a048dfec","resolution":{"observed_at":"2026-08-12T11:25:32.646776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17092","last_updated":"2024-06-24T19:29:47Z","snapshot_observed_at":"2026-08-12T23:35:46.419773Z","submitted_at":"2024-06-24T19:29:47Z","title":"BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17092","snapshot_observed_at":"2026-08-12T11:25:31.998778Z","title":"Beear: Embedding-based adversarial removal of safety backdoors in instruction-tuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:31.998778Z"},"links":{"cited_paper":"/paper/2406.17092","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:db9b78a2bf02d42f997083dc6c9ed60916916b9b8b1b1f1ff125c8464083231f","observation_id":"da08f7d8-802e-4b54-ad50-53fe151022d8","resolution":{"observed_at":"2026-08-12T11:25:31.998778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.628240Z","title":"Composing parameter- efficient modules with arithmetic operation","venue":null,"work_id":"745ab2bd-f1e3-4900-9211-6612813fee8a","year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.003425Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:075d9e597d73cf80534ded63c35f2e97da8f5aa20db7fdbc9ee9097fe273a371","observation_id":"010bb81d-a2cb-4470-b384-d8b380cbae44","resolution":{"observed_at":"2026-08-12T11:25:32.633235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09545","last_updated":"2022-10-18T02:44:38Z","snapshot_observed_at":"2026-08-12T13:49:44.112088Z","submitted_at":"2022-10-18T02:44:38Z","title":"Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09545","snapshot_observed_at":"2026-08-12T11:25:32.007402Z","title":"Fine-mixing: Mitigating backdoors in fine-tuned language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.007402Z"},"links":{"cited_paper":"/paper/2210.09545","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:23be1558c5afbc86fa626ec94dddc48d2ac0f254744326e403f467e761cdabf1","observation_id":"032f5686-5aa0-4cc7-99df-b6fbb46f5b87","resolution":{"observed_at":"2026-08-12T11:25:32.007402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05949","last_updated":"2024-10-09T11:46:24Z","snapshot_observed_at":"2026-07-06T17:14:19.624035Z","submitted_at":"2024-01-11T14:38:19Z","title":"Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05949","snapshot_observed_at":"2026-08-12T11:25:32.011136Z","title":"Universal vulnerabilities in large language models: Backdoor attacks for in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.011136Z"},"links":{"cited_paper":"/paper/2401.05949","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:f0255171ce37b072ab9427db79d9a81e89d348c691c7b1c96c03aa54414d7196","observation_id":"1dbf6ecb-805c-4ddf-b7a4-01f83f182060","resolution":{"observed_at":"2026-08-12T11:25:32.011136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01219","last_updated":"2023-11-10T11:28:53Z","snapshot_observed_at":"2026-08-13T03:24:21.630458Z","submitted_at":"2023-05-02T06:19:36Z","title":"Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01219","snapshot_observed_at":"2026-08-12T11:25:32.015117Z","title":"Prompt as triggers for backdoor attack: Examining the vulnerability in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.015117Z"},"links":{"cited_paper":"/paper/2305.01219","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:765741d657fdb6265760fb571b8beb63e93fa43bbf305773b6f67ba01a55c696","observation_id":"e84309ec-a076-4131-b39f-e964a9566f49","resolution":{"observed_at":"2026-08-12T11:25:32.015117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T11:25:32.019298Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.019298Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:e225b1993240d1211bcc7b9a01dc92676d24fd6db8db197b75a8dfb8f2fbeeb7","observation_id":"3acd0b42-bab0-471d-abc3-b69b35d0b8d6","resolution":{"observed_at":"2026-08-12T11:25:32.019298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:25:32.611227Z","title":"I MPACT OF DIFFERENT MODEL MERGING METHODS","venue":null,"work_id":"fc09055d-cb87-4a15-ba40-3150fbad63d6","year":null},"citing_paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T11:25:32.023656Z"},"links":{"citing_paper":"/paper/2411.18280"},"observation_digest":"sha256:783d85fd1c2b4ba688ddf65013b5f49c2c982080515000691e8ae7f6ff7f236a","observation_id":"79da5425-bc65-4b79-92a8-d1e2be2a7dbc","resolution":{"observed_at":"2026-08-12T11:25:32.618426Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18280","last_updated":"2024-11-27T12:15:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T11:18:50.200137Z","submitted_at":"2024-11-27T12:15:22Z","title":"Neutralizing Backdoors through Information Conflicts for Large Language Models"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 3 inbound Pith citation observations for arXiv:2411.18280."}