{"as_of":"2026-08-17T02:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba9f6b41ca95487a9edcb751a9393b40b980f238e84d18338ea5dfbe1ca3f815","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:24:12.430061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T02:07:33.632292Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-11T18:11:06.025124Z","title":"Universal jailbreak backdoors from poisoned human feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08201","last_updated":"2024-12-11T08:44:15Z","snapshot_observed_at":"2026-08-15T09:51:52.666502Z","submitted_at":"2024-12-11T08:44:15Z","title":"Model-Editing-Based Jailbreak against Safety-aligned Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T18:11:06.025124Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2412.08201"},"observation_digest":"sha256:ae6772ba35461eaead906b9d6e0c96c31ed4190cfaa4d806e845ae3affaf059f","observation_id":"843f8e52-cca2-4732-98aa-63e2f3df7bd8","resolution":{"observed_at":"2026-08-11T18:11:06.025124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-10T20:35:52.818464Z","title":"Universal jailbreak backdoors from poisoned human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07959","last_updated":"2025-02-01T09:30:34Z","snapshot_observed_at":"2026-08-13T01:25:02.967809Z","submitted_at":"2025-01-14T09:23:30Z","title":"Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:52.818464Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2501.07959"},"observation_digest":"sha256:a0c80c60d50bf336b0b18442caf05df146689e6244c65a6bdd28586e7a793d75","observation_id":"ea4c7205-f1b4-4f54-b765-64f8e0121f7e","resolution":{"observed_at":"2026-08-10T20:35:52.818464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-10T18:07:46.877650Z","title":"URL https://arxiv.org/abs/2311.14455","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11621","last_updated":"2025-01-20T17:36:04Z","snapshot_observed_at":"2026-08-14T11:36:00.851001Z","submitted_at":"2025-01-20T17:36:04Z","title":"Trojan Detection Through Pattern Recognition for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:07:46.877650Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2501.11621"},"observation_digest":"sha256:505bc424cc39f4a8b92107d61acf9a5c77982e2233483679f494da24acd65456","observation_id":"8904d5fa-aaf9-4f38-b061-701e550acba6","resolution":{"observed_at":"2026-08-10T18:07:46.877650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-10T14:21:32.870781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17186","last_updated":"2025-01-30T04:02:48Z","snapshot_observed_at":"2026-08-17T01:11:52.725402Z","submitted_at":"2025-01-26T09:43:39Z","title":"Complete Chess Games Enable LLM Become A Chess Master","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T14:21:32.870781Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2501.17186"},"observation_digest":"sha256:1c909c15750135c46e53e7118e20f583bbc2fbed698c4b023207ee2cff2079f3","observation_id":"7e0e3eb9-cf42-431b-8978-7f499194f1a5","resolution":{"observed_at":"2026-08-10T14:21:32.870781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-09T11:34:09.559897Z","title":"Universal jailbreak backdoors from poisoned human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04356","last_updated":"2025-02-04T19:16:56Z","snapshot_observed_at":"2026-08-13T10:55:40.165786Z","submitted_at":"2025-02-04T19:16:56Z","title":"Open Foundation Models in Healthcare: Challenges, Paradoxes, and Opportunities with GenAI Driven Personalized Prescription","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-08-09T11:34:09.559897Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2502.04356"},"observation_digest":"sha256:44bcb305b381e8e4054731853311cf1f93ff066540c3214f2f07dc24c6da8ac5","observation_id":"a702fc4c-b6c0-4577-8df6-dde358651754","resolution":{"observed_at":"2026-08-09T11:34:09.559897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-09T00:50:00.364674Z","title":"Universal jailbreak backdoors from poisoned human feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05224","last_updated":"2025-02-06T04:43:05Z","snapshot_observed_at":"2026-08-13T00:35:04.918294Z","submitted_at":"2025-02-06T04:43:05Z","title":"A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-09T00:50:00.364674Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2502.05224"},"observation_digest":"sha256:14be5cfebced63d1bb1830f3aa8c24f8fd454d8838ff7be194dd6061cf680842","observation_id":"800c2181-654a-4592-b3d5-fa4f73d67cc3","resolution":{"observed_at":"2026-08-09T00:50:00.364674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-16T11:24:12.430061Z","title":"Universal jailbreak back- doors from poisoned human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-08-16T13:11:23.928524Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:12.430061Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2504.15585"},"observation_digest":"sha256:094fe965db7a46ea8cde723ee843290efea12209056fed1e08ce8696f456d5a8","observation_id":"a8abec62-2281-4b3a-b1e6-49930318727c","resolution":{"observed_at":"2026-08-16T11:24:12.430061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-16T11:20:36.423021Z","title":"Universal jail- break backdoors from poisoned human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15867","last_updated":"2025-04-22T13:09:20Z","snapshot_observed_at":"2026-08-16T11:13:44.037358Z","submitted_at":"2025-04-22T13:09:20Z","title":"Inducing Vulnerable Code Generation in LLM Coding Assistants","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:20:36.423021Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2504.15867"},"observation_digest":"sha256:6d9be20338c85ef52567cdd9aa5170b2f4938704158ccc1d6fd1daf5841764f7","observation_id":"352d621b-763a-427f-b92e-f1f81a82f522","resolution":{"observed_at":"2026-08-16T11:20:36.423021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-16T10:38:51.836074Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18598","last_updated":"2025-04-29T02:23:57Z","snapshot_observed_at":"2026-08-16T21:59:37.191431Z","submitted_at":"2025-04-24T16:42:38Z","title":"BadMoE: Backdooring Mixture-of-Experts LLMs via Optimizing Routing Triggers and Infecting Dormant Experts","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T10:38:51.836074Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2504.18598"},"observation_digest":"sha256:3832812d2f19e6c88abfac1324c0d14f6855ae0763445606d77145476cbfab95","observation_id":"731fc1b5-9132-4d42-8c8d-061e18962ee0","resolution":{"observed_at":"2026-08-16T10:38:51.836074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2504.20984","last_updated":"2025-09-10T19:03:48Z","snapshot_observed_at":"2026-08-12T23:40:41.340437Z","submitted_at":"2025-04-29T17:55:52Z","title":"ACE: A Security Architecture for LLM-Integrated App Systems","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T18:05:50.363944Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2504.20984"},"observation_digest":"sha256:56d9bc6b3a7e689f215906bc71374b60415ae64649e1ee58a908c36fa5fee226","observation_id":"055ca13f-a865-4e8b-930a-72311221dd5f","resolution":{"observed_at":"2026-05-22T18:06:54.290344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-07T15:43:33.389364Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-14T13:56:20.363458Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.389364Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:d0d0fa2ad2aabd40fefddb75f51cf696fc36c325bb49c52150c195c999348f42","observation_id":"33bf3e96-e499-4ef8-9020-f5c5256b1d61","resolution":{"observed_at":"2026-08-07T15:43:33.389364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-07T11:18:04.647947Z","title":"Universal jailbreak backdoors from poisoned human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-16T01:19:01.010886Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.647947Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:79afcb854ec101532a0ae2f60953f2cc2fe8b140c7b01a87c42588982521694f","observation_id":"b6007439-ac16-4601-bf79-aefa8c707234","resolution":{"observed_at":"2026-08-07T11:18:04.647947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2507.02850","last_updated":"2026-04-20T16:20:19Z","snapshot_observed_at":"2026-08-17T02:21:16.409356Z","submitted_at":"2025-07-03T17:55:40Z","title":"LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T05:58:17.452837Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2507.02850"},"observation_digest":"sha256:41422540a8650d19c86270486acde08386f3eb273b22604067cdcc26ab4abe32","observation_id":"2f3f7c0d-3860-409d-986d-450d99d89b3c","resolution":{"observed_at":"2026-05-19T06:02:07.883772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-06T19:26:13.702267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-16T11:53:02.284922Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.702267Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:ed73d659a72b5f0f67fde5f47e02680e8c7dfc38f178c12019d3a0be79bce6c3","observation_id":"a3edde7a-2b09-4096-9e4b-c3d793d59ec3","resolution":{"observed_at":"2026-08-06T19:26:13.702267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-05T16:00:48.881724Z","title":"Universal jailbreak backdoors from poisoned human feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-08T05:25:02.825611Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:48.881724Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:b682f68e1a2bdc440b19eab0b5a6be40c604b81d675de31b212a30e4fdd50424","observation_id":"7cd51222-9dc3-4c30-9a49-c03d5c2a14bb","resolution":{"observed_at":"2026-08-05T16:00:48.881724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2603.27517","last_updated":"2026-05-13T20:27:01Z","snapshot_observed_at":"2026-08-12T20:36:39.908117Z","submitted_at":"2026-03-29T04:51:27Z","title":"A Security Analysis of the OpenClaw AI Agent Framework","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T22:22:01.349069Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2603.27517"},"observation_digest":"sha256:9707422b1496ca5f7edbe5b8a56126419eb0af00c17191febdab4c6ca73586c4","observation_id":"e34afee9-ddf0-49b7-b96f-20acfe8a15b2","resolution":{"observed_at":"2026-05-14T22:23:03.421451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2603.27517","last_updated":"2026-05-13T20:27:01Z","snapshot_observed_at":"2026-08-12T20:36:39.908117Z","submitted_at":"2026-03-29T04:51:27Z","title":"A Security Analysis of the OpenClaw AI Agent Framework","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T06:45:24.663069Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2603.27517"},"observation_digest":"sha256:e69c9d517e783151f484a1b03c329e8de5c95bd8860e5c4b6bfe356e6a9939d4","observation_id":"44cd1d8b-909c-469c-a338-a811b1ccf740","resolution":{"observed_at":"2026-05-15T06:49:50.175932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2605.02495","last_updated":"2026-05-25T07:21:41Z","snapshot_observed_at":"2026-08-12T23:44:54.910791Z","submitted_at":"2026-05-04T11:45:38Z","title":"Efficient Preference Poisoning Attack on Offline RLHF","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-08T19:29:25.000361Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2605.02495"},"observation_digest":"sha256:dbcadec039555611677d05cca689178cfa3b6c669b99ed6d2c6d3a1bb50b3422","observation_id":"447dbc6e-7ee6-4acc-a18d-34d8fdd1ea07","resolution":{"observed_at":"2026-05-09T05:50:27.068723Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2605.09397","last_updated":"2026-05-10T07:50:02Z","snapshot_observed_at":"2026-08-13T01:42:47.596656Z","submitted_at":"2026-05-10T07:50:02Z","title":"BadDLM: Backdooring Diffusion Language Models with Diverse Targets","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:13.417357Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2605.09397"},"observation_digest":"sha256:c08cf261c6331b449eebe64e7e87e83f7389277fb7bbca3848ee54d4309fccae","observation_id":"f351d1fe-56f8-4364-b528-5dd31006fb63","resolution":{"observed_at":"2026-05-12T06:11:25.953285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2605.15152","last_updated":"2026-06-03T16:04:16Z","snapshot_observed_at":"2026-08-01T11:20:48.080521Z","submitted_at":"2026-05-14T17:50:39Z","title":"Widening the Gap: Exploiting LLM Quantization via Outlier Injection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:45.542409Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2605.15152"},"observation_digest":"sha256:094ef6fb58a9586844bf651489ae18a2ba34d7ccfdad2255d2b99c7733a0f9e2","observation_id":"8cda201b-f576-49ee-961d-c1f32dc7a68a","resolution":{"observed_at":"2026-06-30T21:05:04.628969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2605.16339","last_updated":"2026-05-07T16:48:48Z","snapshot_observed_at":"2026-08-16T01:15:05.268766Z","submitted_at":"2026-05-07T16:48:48Z","title":"Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:54.238767Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2605.16339"},"observation_digest":"sha256:923e58dc6057b7d07bda035da0ed1f5b72200ca61d4d3645fa81ae80da6a25fe","observation_id":"2489d6a4-7dd4-4708-8615-bc63b45180e8","resolution":{"observed_at":"2026-05-20T22:49:10.163002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2605.16471","last_updated":"2026-05-15T13:53:02Z","snapshot_observed_at":"2026-08-14T00:09:46.311940Z","submitted_at":"2026-05-15T13:53:02Z","title":"From AI-Generated Content to Agentic Action: Security and Safety Threats in Generative AI","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-20T18:08:24.901025Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2605.16471"},"observation_digest":"sha256:cb5764c46a2badd00d7e026e9e1031df4e05ed00725b7284f1115adbe3b4bd0d","observation_id":"378a5fb9-9805-4319-b74a-f759f5dbc1a0","resolution":{"observed_at":"2026-05-20T18:08:50.603159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":"2311.14455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-07-03T02:07:33.632292Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","venue":null,"work_id":"ccb9a8e4-4e6d-4cfc-b777-101287301763","year":2023},"citing_paper":{"arxiv_id":"2606.09411","last_updated":"2026-06-08T12:27:11Z","snapshot_observed_at":"2026-08-16T13:20:41.587605Z","submitted_at":"2026-06-08T12:27:11Z","title":"Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T16:10:18.569412Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2606.09411"},"observation_digest":"sha256:eddd3e5016109b6f87009af8089013fbaa42b26d9bb8e9c0ca754ec0eef67302","observation_id":"04ad651b-896f-407f-b21a-8938c3e38c47","resolution":{"observed_at":"2026-07-03T02:07:33.634083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2311.14455/citation-record","integrity":"/paper/2311.14455/integrity","json":"/paper/2311.14455/citation-record.json","paper":"/paper/2311.14455"},"outbound":[],"paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","latest_version":4,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2311.14455."}