{"as_of":"2026-08-08T06:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e42385342da8c6087d814225243b756893b92cbe2c53da77e6a563b248f41a17","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:24:23.461464Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.07139/citation-record","integrity":"/paper/2508.07139/integrity","json":"/paper/2508.07139/citation-record.json","paper":"/paper/2508.07139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.179314Z","title":"Figure is the first-of-its-kind ai robotics company bringing a general purpose humanoid to life","venue":null,"work_id":"4fbb230e-3d14-4785-8437-e10e3223d74e","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.338114Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:5474debe2eee733533987ee02b3f83aea0a69d4faad0a69f340837b778ee5ccb","observation_id":"7391a8be-7c97-42c9-bb97-0298bf8a5c69","resolution":{"observed_at":"2026-08-05T22:24:24.182075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04306","last_updated":"2025-01-08T06:44:02Z","snapshot_observed_at":"2026-08-05T13:29:08.142882Z","submitted_at":"2025-01-08T06:44:02Z","title":"LLM4SR: A Survey on Large Language Models for Scientific Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04306","snapshot_observed_at":"2026-08-05T22:24:23.341478Z","title":"Llm4sr: A survey on large language models for scientific research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.341478Z"},"links":{"cited_paper":"/paper/2501.04306","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:e4b90e855355705879174b94389f265817290bbd89ee85a9e8312077dd89b2bd","observation_id":"5d1f4862-45a8-48fe-a310-10ff7bc6b967","resolution":{"observed_at":"2026-08-05T22:24:23.341478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09224","last_updated":"2024-11-14T06:40:55Z","snapshot_observed_at":"2026-08-06T02:49:26.012181Z","submitted_at":"2024-11-14T06:40:55Z","title":"Programming with AI: Evaluating ChatGPT, Gemini, AlphaCode, and GitHub Copilot for Programmers","version":1},"cited_work":{"arxiv_id":"2411.09224","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.09224","snapshot_observed_at":"2026-08-05T22:24:24.099457Z","title":"Programming with AI: Evaluating ChatGPT, Gemini, AlphaCode, and GitHub Copilot for Programmers","venue":"cs.SE","work_id":"94801aa6-b9af-4638-9e07-eec205dce3c2","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.344893Z"},"links":{"cited_paper":"/paper/2411.09224","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:e6b383e9a156c9b41645faafd78469499b672b1a6456857df647838447e07637","observation_id":"6b90a4a2-f2f7-499b-a985-a59f4be0b0a1","resolution":{"observed_at":"2026-08-05T22:24:24.102705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.170329Z","title":"Transparency & con- tent moderation","venue":null,"work_id":"56f91213-2057-4ba1-a1a5-46b0170cc66b","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.348342Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:5517547276d107433a7895653aa0076a452fed2a38ecb83ce8910ad0f7d5c5da","observation_id":"5638842d-1e1e-4241-8613-6e8323b004b9","resolution":{"observed_at":"2026-08-05T22:24:24.173535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17704","last_updated":"2025-05-24T12:50:56Z","snapshot_observed_at":"2026-08-07T15:59:26.458348Z","submitted_at":"2025-04-24T16:11:01Z","title":"Safety in Large Reasoning Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17704","snapshot_observed_at":"2026-08-05T22:24:23.351363Z","title":"Safety in large reasoning models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.351363Z"},"links":{"cited_paper":"/paper/2504.17704","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:91edce4032e02f9b0b1501bbbb3e262dd8d005d59507635a5da37bb548ded673","observation_id":"e7308aa5-db82-4b9c-8e55-a541a0873104","resolution":{"observed_at":"2026-08-05T22:24:23.351363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12617","last_updated":"2024-10-23T06:28:19Z","snapshot_observed_at":"2026-08-06T02:11:46.351742Z","submitted_at":"2024-02-20T00:51:05Z","title":"Generative AI Security: Challenges and Countermeasures","version":2},"cited_work":{"arxiv_id":"2402.12617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12617","snapshot_observed_at":"2026-08-05T22:24:24.078464Z","title":"Generative AI Security: Challenges and Countermeasures","venue":"cs.CR","work_id":"53b88735-880f-4b3f-a707-6981963abef0","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.354632Z"},"links":{"cited_paper":"/paper/2402.12617","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:292925d8f6141dd2ace2fc6b0b75b85e52bbb42b051c5dc2b4fc895836785c80","observation_id":"d9ced9b5-dfba-486c-9578-eca36764c4f8","resolution":{"observed_at":"2026-08-05T22:24:24.081871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00898","last_updated":"2024-01-31T19:52:00Z","snapshot_observed_at":"2026-08-06T01:29:20.953609Z","submitted_at":"2024-01-31T19:52:00Z","title":"An Early Categorization of Prompt Injection Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00898","snapshot_observed_at":"2026-08-05T22:24:23.358065Z","title":"An early categorization of prompt injection attacks on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.358065Z"},"links":{"cited_paper":"/paper/2402.00898","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:5cdf9501213c72ee5b5fd5eb8823b50929a78569af9c05c288870573c532709e","observation_id":"8e786645-fec1-4eaa-b3f5-521d89246074","resolution":{"observed_at":"2026-08-05T22:24:23.358065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13457","last_updated":"2024-05-17T05:00:24Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-21T01:26:39Z","title":"A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13457","snapshot_observed_at":"2026-08-05T22:24:23.361494Z","title":"A comprehensive study of jail- break attack versus defense for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.361494Z"},"links":{"cited_paper":"/paper/2402.13457","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:7c57a091bc91f9745eff806a63163deb95194d920abc424edeacf01da26a4984","observation_id":"25f5f323-7136-4f16-b93b-e827df8a1a61","resolution":{"observed_at":"2026-08-05T22:24:23.361494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-05T22:24:23.364780Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.364780Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:bba45dee926a904905cc778a6f1da6912eb0680dac3b816ba6e3a9d307ce644d","observation_id":"aeb3f901-57ff-4af9-acb5-5111c7461fc8","resolution":{"observed_at":"2026-08-05T22:24:23.364780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T22:24:23.367757Z","title":"Zico Kolter, and Matt Fredrik- son","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.367757Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:0893127d01be1e5ec8d1cd65732eb43f53804e50ae478848b33c5d3064599d14","observation_id":"f9154070-1a34-4e73-923e-6ee24ea89336","resolution":{"observed_at":"2026-08-05T22:24:23.367757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T22:24:23.370952Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.370952Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:21edb21e7fb4c3c1d62d0d77c3762ebb44e8f4e9475d7f75387d2a0e7206744f","observation_id":"7d61f6a0-21f0-49ac-8c78-8c4f567ec487","resolution":{"observed_at":"2026-08-05T22:24:23.370952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03876","last_updated":"2024-12-21T11:24:01Z","snapshot_observed_at":"2026-07-06T18:41:31.849952Z","submitted_at":"2024-07-04T12:14:27Z","title":"Automated Progressive Red Teaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03876","snapshot_observed_at":"2026-08-05T22:24:23.374081Z","title":"Auto- mated progressive red teaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.374081Z"},"links":{"cited_paper":"/paper/2407.03876","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:71dc74c19af481beb8b79b1a40d84b1e6b349b6a4df155b242980da2efcc9591","observation_id":"36f81cd8-a2af-4bc7-9036-38570bad6593","resolution":{"observed_at":"2026-08-05T22:24:23.374081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T22:24:23.377564Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.377564Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:38b7f01f2425f2dbab82fec1048f28952f6c4073dbdefcb5e0fa7ac7b0750917","observation_id":"f5881f87-bd05-4c12-9048-d554c8f0467d","resolution":{"observed_at":"2026-08-05T22:24:23.377564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.380458Z","title":"Guardreasoner: Towards reasoning-based llm safeguards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.380458Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:dae5ab6e3e9fd5c0b9fa6c91875898ac9e119a19bdc9d520e621aa78c1915336","observation_id":"4091594c-9b3b-432b-a662-ee436b4b52d9","resolution":{"observed_at":"2026-08-05T22:24:23.380458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-05T22:24:23.383158Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.383158Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:7e62dd5a35f78b86c3f50cbdfdceba5857ae58c165fb5fbaec19d04da35ea861","observation_id":"27b1f05c-b712-400d-9fbf-e9f05964dca7","resolution":{"observed_at":"2026-08-05T22:24:23.383158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-05T22:24:23.386156Z","title":"Detecting language model attacks with perplexity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.386156Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:7e23fb89e79f9684fcbd4850e375d2ae15fef5f00c8ebdbfe64d62665a88fc72","observation_id":"a14cefd3-7265-4657-a8ff-e57cf764095e","resolution":{"observed_at":"2026-08-05T22:24:23.386156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17263","last_updated":"2024-11-08T06:57:05Z","snapshot_observed_at":"2026-08-06T04:09:50.828544Z","submitted_at":"2024-01-30T18:56:08Z","title":"Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17263","snapshot_observed_at":"2026-08-05T22:24:23.388868Z","title":"Ro- bust prompt optimization for defending lan- guage models against jailbreaking attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.388868Z"},"links":{"cited_paper":"/paper/2401.17263","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:15ef4d603354ea4fc12f4ff0d8ecb4ff2f98f0b63e7ae334799d8315fd652f7d","observation_id":"cadf9baa-dbf5-470b-94e7-9452b8d9df02","resolution":{"observed_at":"2026-08-05T22:24:23.388868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.391656Z","title":"Darkmind: Latent chain-of-thought backdoor in customized llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.391656Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:8c7a1b6a2365e757c3163d646df89b51c356924df8736b13f990346808e29693","observation_id":"eae6fbe7-eee7-4c94-98b8-9d683797b3b1","resolution":{"observed_at":"2026-08-05T22:24:23.391656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-05T22:24:23.394303Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.394303Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:3f88e3a1a2a9f3b77b5379f0334aad4536782a60df067fc813d3b133acd56610","observation_id":"65c8ba88-8154-4c93-9a36-c3bc90625b88","resolution":{"observed_at":"2026-08-05T22:24:23.394303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11272","last_updated":"2024-10-15T04:53:34Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T04:53:34Z","title":"Cognitive Overload Attack:Prompt Injection for Long Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11272","snapshot_observed_at":"2026-08-05T22:24:23.397460Z","title":"Cognitive overload attack: Prompt injection for long context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.397460Z"},"links":{"cited_paper":"/paper/2410.11272","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:3eefe532b8bf37b91ddf52317683c922033e3af0f3faa82a614d40b6028a61d9","observation_id":"a0fce363-85d8-440d-a75a-6b4fbf955769","resolution":{"observed_at":"2026-08-05T22:24:23.397460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09096","last_updated":"2024-06-12T08:28:15Z","snapshot_observed_at":"2026-08-05T11:53:45.759441Z","submitted_at":"2023-11-15T16:42:29Z","title":"Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09096","snapshot_observed_at":"2026-08-05T22:24:23.400378Z","title":"Defending large language models against jailbreaking at- tacks through goal prioritization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.400378Z"},"links":{"cited_paper":"/paper/2311.09096","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:d81d927ebbd2b55023e4bbd90ab07b7e34e0d5168f3777cc9950bca293e6d3cf","observation_id":"c9d93443-48d4-44b2-a70e-26cad4fef8f2","resolution":{"observed_at":"2026-08-05T22:24:23.400378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-08-05T22:24:23.403420Z","title":"Certifying llm safety against adversarial prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.403420Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:0bb17fb54f78f518d079e96278c7718fb220cdaa307772a1f64aca19f3953d04","observation_id":"c02eec3d-2f04-4f2e-9a7c-0af33298520a","resolution":{"observed_at":"2026-08-05T22:24:23.403420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06363","last_updated":"2024-09-25T19:48:39Z","snapshot_observed_at":"2026-07-06T17:27:58.440355Z","submitted_at":"2024-02-09T12:15:51Z","title":"StruQ: Defending Against Prompt Injection with Structured Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06363","snapshot_observed_at":"2026-08-05T22:24:23.406310Z","title":"Struq: Defending against prompt injection with structured queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.406310Z"},"links":{"cited_paper":"/paper/2402.06363","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:fabd4a74b9bd42c6e0dac3552698f08d46e56ff2d79c93d1eb4bedd7a0243e46","observation_id":"c18ad7e4-5ccd-4f0c-9ba0-097ab8d99443","resolution":{"observed_at":"2026-08-05T22:24:23.406310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20769","last_updated":"2025-04-29T13:50:05Z","snapshot_observed_at":"2026-08-07T15:58:12.960607Z","submitted_at":"2025-04-29T13:50:05Z","title":"Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20769","snapshot_observed_at":"2026-08-05T22:24:23.409209Z","title":"Chain-of-defensive-thought: Structured reason- ing elicits robustness in large language mod- els against reference corruption","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.409209Z"},"links":{"cited_paper":"/paper/2504.20769","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:7c5839ba0f88425f1307cd8631e9e9c47ba704d3028ec7aa57b31798b92167f2","observation_id":"6a85e04b-2048-4be5-8a44-fb8cd3b497a4","resolution":{"observed_at":"2026-08-05T22:24:23.409209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00029","last_updated":"2024-08-18T22:26:13Z","snapshot_observed_at":"2026-08-04T14:02:44.974740Z","submitted_at":"2023-11-16T07:31:18Z","title":"Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00029","snapshot_observed_at":"2026-08-05T22:24:23.412222Z","title":"Bergeron: Combat- ing adversarial attacks through a conscience- based alignment framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.412222Z"},"links":{"cited_paper":"/paper/2312.00029","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:56e81b27782d683204cd874c1c840570963d59583a7a580d121db766d348f5f3","observation_id":"5914d115-67d8-40fc-9bc3-059d850101bb","resolution":{"observed_at":"2026-08-05T22:24:23.412222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12702","last_updated":"2024-06-21T00:05:35Z","snapshot_observed_at":"2026-08-07T00:32:04.625068Z","submitted_at":"2024-06-18T15:14:35Z","title":"[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs","version":2},"cited_work":{"arxiv_id":"2406.12702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12702","snapshot_observed_at":"2026-08-05T22:24:23.769248Z","title":"[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs","venue":"cs.CL","work_id":"29e48471-a978-4493-a3cf-f91dd8c997da","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.415082Z"},"links":{"cited_paper":"/paper/2406.12702","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:f92d997728cded7dac641c20d9fa6eeacad52b9b693a5a2a225040f6c1b3e849","observation_id":"0b083229-859f-45e9-ba9a-04ba2282bedb","resolution":{"observed_at":"2026-08-05T22:24:23.773604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.417921Z","title":"Inverse scaling in test-time compute","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.417921Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:9d2692fc80546c71df28865c929180c14280ce4f2344dea5b64a38d8db6be68b","observation_id":"bc9fc4d6-c4ad-4bc0-9fea-29acd3183568","resolution":{"observed_at":"2026-08-05T22:24:23.417921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-05T22:24:23.420770Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.420770Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:a037faae5eefaf4eb02ad13ce6a1ff6ac81845f404c73516ab86ba48d157e785","observation_id":"292270f7-49e3-409b-9f56-b2d029405619","resolution":{"observed_at":"2026-08-05T22:24:23.420770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-05T22:24:23.423635Z","title":"Tree of attacks: Jail- breaking black-box llms automatically","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.423635Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:9b65b00d30d4a7f47268dd2adf5dbacc2ed736a40d8745791b1b4385aa5d99e9","observation_id":"0a29a3b9-574a-4820-b283-be94d39e5285","resolution":{"observed_at":"2026-08-05T22:24:23.423635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14368","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.665510Z","title":"Is your prompt safe? inves- tigating prompt injection attacks against open- source llms","venue":null,"work_id":"6d4cc548-fb08-464a-912b-80a68cde29da","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.426274Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:bd0e6738bbfabf469d2af1d668e4b2f62a3143ced9d756d8f30f4b65742ac6f9","observation_id":"a0d877c6-550c-49dc-ad53-43e90eb75a82","resolution":{"observed_at":"2026-08-05T22:24:23.671877Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T22:24:23.428703Z","title":"Jailbreak and guard aligned lan- guage models with only few in-context demon- strations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.428703Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:34696d23525fc351fe352f8282cccfc0fd753e40af462284d8b8034a9f0681e8","observation_id":"11d2042c-6acd-4c2f-8ba3-21a2845c9a02","resolution":{"observed_at":"2026-08-05T22:24:23.428703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.161629Z","title":"Novel uni- versal bypass for all major llms: The pol- icy puppetry prompt injection technique","venue":null,"work_id":"951022a7-e3f0-4b3b-ae46-11f921346417","year":null},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.431436Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:a209688e466f7e496ffdd96f08364b37248b4c8bb2ad694fa2acbdda9dd659f0","observation_id":"169c30b9-ac90-405b-ad14-488529ed8d30","resolution":{"observed_at":"2026-08-05T22:24:24.164461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.437009Z","title":"Gasp: Ef- ficient black-box generation of adversarial suf- fixes for jailbreaking llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.437009Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:8a68b39a0fce076b1e8047c5a5da7123fee97a3e0d8315dba880d91b4ca5c5f7","observation_id":"bc7c92e6-da17-4e6a-bb46-6f84710aca3a","resolution":{"observed_at":"2026-08-05T22:24:23.437009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.144237Z","title":"Jailbreakchat","venue":null,"work_id":"cc4cdb57-c9c3-456d-95dc-adaac51a9932","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.439933Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:29bce49e52d9eb70722e72852320efe9cdae441a7b0f90fe62cbdd6f9d93f51a","observation_id":"175940b2-da68-45f0-a1c1-2ea318351b51","resolution":{"observed_at":"2026-08-05T22:24:24.147077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.135349Z","title":"Gemini loki gem (no limits)","venue":null,"work_id":"5a96cb40-7231-4ecd-bb1e-434d4ed0f715","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.442501Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:0eee1738698ae029519ea0ad4da1898129a99f7bca946a3a5b288a2d0493f379","observation_id":"a2d3994d-878a-40a9-9533-c321ca8cf22f","resolution":{"observed_at":"2026-08-05T22:24:24.138665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.126537Z","title":"Jailbreaks","venue":null,"work_id":"d9cc9ef5-5cae-4328-bb12-62711a896988","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.445028Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:338cbbbebb79ca70da49e4aa6b99d9d6ac193a42d751bc9121b28aeed8244a73","observation_id":"3afbdf64-a2d6-4552-8966-43ceb54b7426","resolution":{"observed_at":"2026-08-05T22:24:24.129526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05498","last_updated":"2025-02-05T10:29:07Z","snapshot_observed_at":"2026-07-06T18:27:33.030221Z","submitted_at":"2024-06-08T15:45:31Z","title":"SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05498","snapshot_observed_at":"2026-08-05T22:24:23.447796Z","title":"Selfdefend: Llms can defend themselves against jailbreaking in a practical manner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.447796Z"},"links":{"cited_paper":"/paper/2406.05498","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:d35ba1175cd24fe974e1e2cacacd63a1ef8ac049d65111fb7a838f01d5782d13","observation_id":"a0f85fb0-18e7-4f1b-9981-7406b00454ee","resolution":{"observed_at":"2026-08-05T22:24:23.447796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-07T06:17:52.920196Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-05T22:24:23.450421Z","title":"Autodefense: Multi- agent llm defense against jailbreak attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.450421Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:37228b7b4c4a18e80c91b7bf877aa562bb9c349c1d6e250cbdff2bae125428c6","observation_id":"f41039d3-9d9d-411b-99f0-e8eda572e6bf","resolution":{"observed_at":"2026-08-05T22:24:23.450421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20965","last_updated":"2025-06-13T22:43:06Z","snapshot_observed_at":"2026-08-07T15:58:07.339962Z","submitted_at":"2025-04-29T17:36:05Z","title":"AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20965","snapshot_observed_at":"2026-08-05T22:24:23.453331Z","title":"Bartoldson, Bhavya Kailkhura, Tom Goldstein, and Furong Huang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.453331Z"},"links":{"cited_paper":"/paper/2504.20965","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:1fe1089b980b063568415860e97fa75431cba9fbe6adfe727a0032a9fc8679ea","observation_id":"e78c59b7-4194-4955-bbbb-d5b4e002dda8","resolution":{"observed_at":"2026-08-05T22:24:23.453331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-05T22:24:23.455996Z","title":"Pappas, Florian Tramer, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.455996Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:0887c7430e9d4474e11164e08bcf38c184dc4e99b13e1cbd29cf0cb923bf2e93","observation_id":"33142d37-3f13-4dd2-a5dd-8f29cc5f9291","resolution":{"observed_at":"2026-08-05T22:24:23.455996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-07-06T19:08:48.648862Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-05T22:24:23.458700Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.458700Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:8352dc602bb50b8c605164873b0e49c8d7d35ad453592ef896c6f5ad38ee1284","observation_id":"7acea42f-75e7-47b0-adfb-176c818a5870","resolution":{"observed_at":"2026-08-05T22:24:23.458700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.117752Z","title":"Prompt injections bench- mark","venue":null,"work_id":"eac975fc-8c04-4ef0-8c03-9d73606e06a1","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.461464Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:35fda50afb79fde5aaa1bc9b123267136b1b933f8e01c53963bc89697def0cf6","observation_id":"38cfd376-935a-4299-bfdd-150911536cc0","resolution":{"observed_at":"2026-08-05T22:24:24.120690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.152803Z","title":null,"venue":null,"work_id":"399081cc-20da-4b06-966a-0dc893aa7310","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.434501Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:46747bedd45784d524da315f0d627c545c313545ea9571e197845529ffbd51fb","observation_id":"5768ea9b-0038-4677-b9f1-61873ad621bf","resolution":{"observed_at":"2026-08-05T22:24:24.155549Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T02:11:07.077923Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":31,"verified_exact":4,"verified_fuzzy":7},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2508.07139."}