{"as_of":"2026-08-08T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adab8f16fa3928df4d0053ce650d1e1a55e2fca6e3a7d22ecd3ae5cfc35478ad","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:32:31.644019Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:18:40.623601Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T17:51:41.885862Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"cited_work":{"arxiv_id":"2505.18556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18556","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G.; and Wang, H","venue":null,"work_id":"53acb55b-bc86-40cc-a165-214c3de73d8f","year":2025},"citing_paper":{"arxiv_id":"2509.10546","last_updated":"2026-04-24T18:29:01Z","snapshot_observed_at":"2026-08-02T04:58:06.974646Z","submitted_at":"2025-09-07T22:35:15Z","title":"Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-18T17:49:42.112564Z"},"links":{"cited_paper":"/paper/2505.18556","citing_paper":"/paper/2509.10546"},"observation_digest":"sha256:70563c38c6192db182f3103c1688bfaebd519a24bedb74a88607728b9830a6a5","observation_id":"4a48bd81-4ad5-4d9e-b690-0bbcb0aab7c9","resolution":{"observed_at":"2026-05-18T17:51:41.887953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"cited_work":{"arxiv_id":"2505.18556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18556","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G.; and Wang, H","venue":null,"work_id":"53acb55b-bc86-40cc-a165-214c3de73d8f","year":2025},"citing_paper":{"arxiv_id":"2601.02670","last_updated":"2026-04-08T04:11:40Z","snapshot_observed_at":"2026-07-06T22:40:46.465095Z","submitted_at":"2026-01-06T02:58:22Z","title":"Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T18:04:44.543311Z"},"links":{"cited_paper":"/paper/2505.18556","citing_paper":"/paper/2601.02670"},"observation_digest":"sha256:b7f4fc0c7c13866a2b84bfd5325c368f1ed46886923627a7cad5d794440865b1","observation_id":"49805767-a29c-4379-acc2-cebec45087db","resolution":{"observed_at":"2026-05-16T18:08:13.066346Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18556","snapshot_observed_at":"2026-08-02T13:18:40.623601Z","title":"arXiv preprint arXiv:2505.18556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20473","last_updated":"2026-05-24T08:11:40Z","snapshot_observed_at":"2026-08-08T06:43:34.898524Z","submitted_at":"2026-05-24T08:11:40Z","title":"Incomplete Prompt Jailbreaks in Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T13:18:40.623601Z"},"links":{"cited_paper":"/paper/2505.18556","citing_paper":"/paper/2607.20473"},"observation_digest":"sha256:87fb61eadb0853ded033b3eacdcbb652770e15cb0a88ba41b645edf7f81db494","observation_id":"d40ec3d7-7faa-417d-b17c-e93b52d8736f","resolution":{"observed_at":"2026-08-02T13:18:40.623601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18556/citation-record","integrity":"/paper/2505.18556/integrity","json":"/paper/2505.18556/citation-record.json","paper":"/paper/2505.18556"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:28.368220Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.368220Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:1dbcc6ff95732428c3a5e3205239a1669850258ecfa85bdd95bdf9e3e01a3d1e","observation_id":"b431b791-0fd2-4ac2-90f8-61f550819cd4","resolution":{"observed_at":"2026-08-07T14:32:28.368220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:28.460572Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.460572Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:ce4039cdfcce44eee8fb5a4d2faf6ffa0bf0a039ed46ac37d12d74df4d7025b8","observation_id":"3172e170-78cf-451b-a001-86059b6107a0","resolution":{"observed_at":"2026-08-07T14:32:28.460572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:35.648788Z","title":null,"venue":null,"work_id":"5b51bbad-77f8-4c66-812a-4d503219a5fc","year":2025},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.546314Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:b225a6abe76d1f22b09979a990e83d6f9121de90ee9c4e52286ac7b3b4d8956f","observation_id":"e41aa9c5-5712-43fd-88d4-784ad7b7964d","resolution":{"observed_at":"2026-08-07T14:32:35.729169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:35.490940Z","title":null,"venue":null,"work_id":"b9d08a27-ea38-4122-8469-042879982cc4","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.583911Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:256184a9a2491ac9a80ea8f226da9607e2fc95ff2cf38c3a322100ff8e00473b","observation_id":"b126d2e1-42ec-4643-b165-ef19f7956778","resolution":{"observed_at":"2026-08-07T14:32:35.556435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:35.363346Z","title":null,"venue":null,"work_id":"c0584cb0-128b-4f69-b46b-ff7ece121e93","year":2020},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.655389Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:6c5028891a3e7bb3ad7e706f7ca65021c6af8cf9920f37128c20318858a54d1a","observation_id":"09c0e544-7a5d-481a-80b9-12e2c9a810fa","resolution":{"observed_at":"2026-08-07T14:32:35.407729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:28.748572Z","title":"Pappas, Florian Tramèr, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.748572Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:a525c861ab57b499389fc7fc1a4ac45fd8caff0c018d62806970f01a5c8ab3f2","observation_id":"4ee2aaab-b997-4149-aaac-e5d97dde2032","resolution":{"observed_at":"2026-08-07T14:32:28.748572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T14:32:28.798711Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.798711Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:7087afb727bc108248dce5ca2f0188b777d4850f525b88d9083fe6c95d768794","observation_id":"506c0bed-abf0-423f-8d97-e31c7977d43e","resolution":{"observed_at":"2026-08-07T14:32:28.798711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07084","last_updated":"2023-12-08T16:42:39Z","snapshot_observed_at":"2026-08-07T23:14:33.946557Z","submitted_at":"2022-08-15T09:27:34Z","title":"Z-BERT-A: a zero-shot Pipeline for Unknown Intent detection","version":3},"cited_work":{"arxiv_id":"2208.07084","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.07084","snapshot_observed_at":"2026-08-07T14:32:32.217388Z","title":"Z-BERT-A: a zero-shot Pipeline for Unknown Intent detection","venue":"cs.CL","work_id":"c5d08308-8abd-4547-a841-24ca75d184f3","year":2022},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.849543Z"},"links":{"cited_paper":"/paper/2208.07084","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:49238e072dc653bfc7e57b18ba5bef6513d7334d6b257f4eb921a84cdbca8bb9","observation_id":"1b0ffcb1-bb92-4f76-a247-4ef24ff1250b","resolution":{"observed_at":"2026-08-07T14:32:32.295390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:35.286659Z","title":null,"venue":null,"work_id":"f6e1206b-c3fd-488a-aa6c-6cf4abebad4b","year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:28.949530Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:36bc09345ab89ec83433ac5f8805088799ff294f9f4cab0801ff7e2a591cbea0","observation_id":"de1eedfa-e02d-4ed1-9394-bf001ae8372d","resolution":{"observed_at":"2026-08-07T14:32:35.319299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:35.252560Z","title":null,"venue":null,"work_id":"87edf0a4-468a-4a5e-8066-5d6eaf8ae681","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.030810Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:e0ee904ce47ff393ff139e8ea4f46acb7d9d8be6ff80a11c6981808ef0991163","observation_id":"0c92bd8b-b5ce-4772-aa71-25501a945267","resolution":{"observed_at":"2026-08-07T14:32:35.258130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:32:29.074711Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.074711Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:24bf4e4753933e4e2d1fff5440d6416a19452b800695183be0519ff647415ac1","observation_id":"a2b84897-36d2-4d2b-84ef-9eaac98ee83e","resolution":{"observed_at":"2026-08-07T14:32:29.074711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:32:29.133774Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.133774Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:c7af79708b4a7934b80240701ef849023819ca1b53d06118ca8dd11bc22ef222","observation_id":"83ece4b4-ec12-41c9-9c8b-c471793193ec","resolution":{"observed_at":"2026-08-07T14:32:29.133774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:35.109223Z","title":null,"venue":null,"work_id":"17ed37aa-c903-4bcd-9095-141c0c8e0a61","year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.224704Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:233d0b4eac85cc45ee20a0524c2447bdc959dcfd51f0bd6e7c47b82d325ae6a1","observation_id":"31a650b5-5135-4391-bedc-1ad88c054921","resolution":{"observed_at":"2026-08-07T14:32:35.139141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:32:29.287134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.287134Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:f674a76c0e98fb9d46923600ad846d8ecb19f33ed4eb256c292276a0bc00ebb0","observation_id":"1a8a5e0b-ea4e-4b82-bd59-b5d088003154","resolution":{"observed_at":"2026-08-07T14:32:29.287134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:32:29.320086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.320086Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:1841fae741643813586365028bfa2f0fd05c836782ca63a4202053caea12c714","observation_id":"882510a1-c0c5-42ec-88dd-476aca8704e5","resolution":{"observed_at":"2026-08-07T14:32:29.320086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:29.432174Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.432174Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:f7f1181881405c2a63f4a6f9070b0e7b31239cf4c53c2a2f768596908303e4f7","observation_id":"5f64d5f7-277b-49ed-9b32-797732415312","resolution":{"observed_at":"2026-08-07T14:32:29.432174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:29.510906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.510906Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:09ad535af4b42ae1e1bb731bc9f2a0a63f430ff1ae2c89595db39c3cf7bd495f","observation_id":"df9b1b16-5935-4d78-86de-5a319a58074c","resolution":{"observed_at":"2026-08-07T14:32:29.510906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.991796Z","title":null,"venue":null,"work_id":"08d0a22a-da83-4c68-8257-6e90d48ae718","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.539612Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:8005bd734476ac0cde7d396cc56c6d330e6ff345659c2072b6981efecb4481b5","observation_id":"51e6f370-574e-401e-8292-f543d35becb0","resolution":{"observed_at":"2026-08-07T14:32:35.039835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.852695Z","title":null,"venue":null,"work_id":"9f191e25-0732-46c3-a623-fb0cf5a5ad81","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.633976Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:01cd27716e839702eaaacbc642be13b94e3a1e0408a79af744392da741ccba4d","observation_id":"81e35d6b-b051-47dc-b881-75a029c5c93b","resolution":{"observed_at":"2026-08-07T14:32:34.913348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01446","last_updated":"2024-08-05T11:34:10Z","snapshot_observed_at":"2026-08-04T21:02:05.722226Z","submitted_at":"2023-09-04T08:54:20Z","title":"Open Sesame! Universal Black Box Jailbreaking of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01446","snapshot_observed_at":"2026-08-07T14:32:29.722321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.722321Z"},"links":{"cited_paper":"/paper/2309.01446","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:588320f5dcaeebcb924778461b1380e5979ab6101a0034871d20292a8215455d","observation_id":"9820e81e-1a97-4abd-9d41-c424982aea51","resolution":{"observed_at":"2026-08-07T14:32:29.722321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.751575Z","title":null,"venue":null,"work_id":"2c6f1bc5-49a2-49a7-82f3-fc8f06a1a6cc","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.790056Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:e82032ea6b7fba5899226d2e6d352fac31d4126b18528ec292862d9b115aa83b","observation_id":"3251d485-49a5-4b94-835f-62a66192a6df","resolution":{"observed_at":"2026-08-07T14:32:34.776349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:32:29.834692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.834692Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:2581ff9897eb7b6bea0bb20f45862c2d4450c9c666693c1dcef0f2ec90db5929","observation_id":"242c95c8-92d6-4104-b7ba-e7860536e439","resolution":{"observed_at":"2026-08-07T14:32:29.834692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-07T14:32:29.915875Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.915875Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:50a610fafac28a1bfbdddfb1a3776e2ecf417b139065e26f6ee437fd24fd2419","observation_id":"87f4dd05-014a-4240-89c4-2321628b6b58","resolution":{"observed_at":"2026-08-07T14:32:29.915875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.652800Z","title":null,"venue":null,"work_id":"f1963ccf-d232-421f-becc-03683035f4ed","year":2025},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.970460Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:76d442ffeaab078826ff2423261c92cc187bcf5e8da42858d7f7b1bb9503507a","observation_id":"0d61b577-7030-4b17-a34d-833315d29f99","resolution":{"observed_at":"2026-08-07T14:32:34.706179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-07T14:32:30.021994Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.021994Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:84eb2bbc988a91f0458eeacbb537fff86555ffcef616b8ffd89ae78396a40f61","observation_id":"5991bb0f-c38b-479b-86b3-021d59dccfc8","resolution":{"observed_at":"2026-08-07T14:32:30.021994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:30.064116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.064116Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:001fe81305b6d275007b4dd598416b794904dbed3d17c5339abd50b1f282464c","observation_id":"a8e1c95f-3cdb-4dd7-939e-16de1224f06f","resolution":{"observed_at":"2026-08-07T14:32:30.064116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.522039Z","title":null,"venue":null,"work_id":"3008cead-44fc-44d4-8eaa-354a036e0774","year":2025},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.138925Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:69cfde3c620107f5d790159bc2ebbb0ff0a7178871672ba0b20615dd753a9738","observation_id":"4601b9e5-8120-418b-a1fd-0461eb6ece5c","resolution":{"observed_at":"2026-08-07T14:32:34.577088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.428850Z","title":null,"venue":null,"work_id":"5764ee88-d575-4215-aeb3-7d3a96e03dfb","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.229495Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:665e7f9740759ed6b8f5f8e3dc407c90119edf4c9f9659db30631c9736b40886","observation_id":"bd04e60b-495f-4d0b-859a-a2c0b99cf229","resolution":{"observed_at":"2026-08-07T14:32:34.464284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.319204Z","title":null,"venue":null,"work_id":"f602c6c6-9d6f-4726-a30b-3dbc678e6432","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.267198Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:02c7167c561e4f220810cd8ebcc7b0d10d3d5096554373a1a3a890c9c6e9e8d0","observation_id":"48f16cf2-8790-4d24-b2d3-f2a00cc4603e","resolution":{"observed_at":"2026-08-07T14:32:34.372707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10670","last_updated":"2024-11-16T02:16:59Z","snapshot_observed_at":"2026-08-03T07:51:20.238336Z","submitted_at":"2024-11-16T02:16:59Z","title":"IntentGPT: Few-shot Intent Discovery with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10670","snapshot_observed_at":"2026-08-07T14:32:30.352898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.352898Z"},"links":{"cited_paper":"/paper/2411.10670","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:f6321382ad13ffb415a12f70988bb77237db7c7f214543c676e023e0bbbd750d","observation_id":"7f88d5ee-0bcf-4695-9c52-275fba0d9acb","resolution":{"observed_at":"2026-08-07T14:32:30.352898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.197702Z","title":null,"venue":null,"work_id":"f96a50c3-0e6d-4e2f-87e2-a6d3838d1608","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.432860Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:b6c8b0013eddeecf1893ea22420dfa12b041ea0e6f9167485baeceeb94b987d1","observation_id":"38ce1dea-3956-4aaf-bb0c-193073a598e0","resolution":{"observed_at":"2026-08-07T14:32:34.218954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:34.118009Z","title":null,"venue":null,"work_id":"45c4e309-ade5-4230-aded-099b909c63f3","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.483183Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:018b757affec567117fd525e27e2f0fef2b39f5c4105a56419900675c0483802","observation_id":"3d3b302f-04de-4aeb-ad6b-60458330f346","resolution":{"observed_at":"2026-08-07T14:32:34.141225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:33.979975Z","title":null,"venue":null,"work_id":"1739a397-9449-4600-83fd-dc8884b368ee","year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.534650Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:cead06cb52aa71ef217f279c6f2b8edcc6a62472966f0d654fca78775b123fe9","observation_id":"003315bc-28a4-43f6-b6d9-af64111e6ab6","resolution":{"observed_at":"2026-08-07T14:32:34.031105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:33.863938Z","title":null,"venue":null,"work_id":"5964f344-675f-4573-8cf5-24b2a72a1eb9","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.565324Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:4c11d048fdaaf4c92eef551601a5382a718c66253d01d2d3c1bac5f0dde07e3f","observation_id":"ef5bb73a-5f1c-4140-ab2f-96bfc7a71cc3","resolution":{"observed_at":"2026-08-07T14:32:33.904284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:33.767619Z","title":null,"venue":null,"work_id":"aa9d48a5-3c5f-4641-966e-b02b3da5a7bc","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.652851Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:6493cf40fceecae6cd09bd6a7197f3713088f6097371a036448150de40925896","observation_id":"61305ab5-bfa8-431c-a5a8-6c4fadff7ba4","resolution":{"observed_at":"2026-08-07T14:32:33.820745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T14:32:30.720380Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.720380Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:8c3d62be5e6eef03026b2755ca2ab2bd4edca63fb7e97b6f8e7894d8e825cf59","observation_id":"50dc41cf-1536-4e7b-869a-64ad6d1d0615","resolution":{"observed_at":"2026-08-07T14:32:30.720380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16667","last_updated":"2024-07-23T17:34:36Z","snapshot_observed_at":"2026-07-06T18:50:48.181248Z","submitted_at":"2024-07-23T17:34:36Z","title":"RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16667","snapshot_observed_at":"2026-08-07T14:32:30.773525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.773525Z"},"links":{"cited_paper":"/paper/2407.16667","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:974d164f848e848cc233f4fea4239ac052e84d30cb48968708fb68abbb2a77aa","observation_id":"aaf8c749-40c7-4757-a814-50bc26cf75e1","resolution":{"observed_at":"2026-08-07T14:32:30.773525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:33.625140Z","title":null,"venue":null,"work_id":"5f451ccd-a9f7-4d92-8cca-36948d38593a","year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.817410Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:5c2c9a65e723f64f08776e131160a3da3f51ad523125514e65a9875d11829cda","observation_id":"739e6a25-7f9e-4c5f-9925-4b25d9d16e52","resolution":{"observed_at":"2026-08-07T14:32:33.698410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:33.444741Z","title":null,"venue":null,"work_id":"4a2f98d3-4ef3-42fb-aae2-f09dfbe949a1","year":2025},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.859591Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:2e5b3a43679054d551edbb8f3b33a94be7a880800bdb38cb47ae3842d421d7a4","observation_id":"213c098c-63ae-4d11-aee0-962ef541656e","resolution":{"observed_at":"2026-08-07T14:32:33.523536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:30.919666Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.919666Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:176b1ffef6d507a9cc408c34090bc1a4f2e74a19659ea76269cf3fb45047c798","observation_id":"791bdf0f-7e6b-4e1e-bcd8-d243c270fae0","resolution":{"observed_at":"2026-08-07T14:32:30.919666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-07T14:32:31.034762Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.034762Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:bea46196cebdd9ba607d4f5afbcfa8e4e35db7f19374d3ab5ae436a46afc3c78","observation_id":"e2fcdcaf-b1b8-419a-b03b-8dc884c67fa1","resolution":{"observed_at":"2026-08-07T14:32:31.034762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:33.233468Z","title":null,"venue":null,"work_id":"1db3cff0-7213-4e96-8ced-a1da0646384c","year":2025},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.088188Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:fc2e7c59e2478915f8fc80591c2ed2058da67c3bc0683dc4023e7acb4c07855d","observation_id":"041362cf-344d-431d-9f65-b2f644b51495","resolution":{"observed_at":"2026-08-07T14:32:33.326229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-07T14:32:31.124752Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.124752Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:ca3da5b9662924e0fbca62dd4a93915fc383e66ae03f1b6d0e4876e5f33b4a81","observation_id":"4cf9ed77-4cdd-4c78-ba1c-76616ac9bf66","resolution":{"observed_at":"2026-08-07T14:32:31.124752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:33.095900Z","title":null,"venue":null,"work_id":"ea40a9aa-19b9-4d23-b7a7-ff6828cb3e1b","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.185153Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:84119ccade2cd7354a7f41dc1c7af45afc47d673ff123992bbd808240f46c238","observation_id":"deb7a500-333c-4e9e-af3a-52a49d38e0eb","resolution":{"observed_at":"2026-08-07T14:32:33.130348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:32.959435Z","title":null,"venue":null,"work_id":"d8b5b708-bcbc-4d03-91c2-20d578aff906","year":2021},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.272832Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:11a00e66518be52d49936b48bcdd23431424b46061f2edb99ac1853ae90cb9c2","observation_id":"7549e762-cf0c-45fa-9cd5-6c51e9a911ec","resolution":{"observed_at":"2026-08-07T14:32:33.012359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:32.792942Z","title":null,"venue":null,"work_id":"9b51b4a8-7a02-4580-9d28-75fc6f74d62c","year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.346209Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:f18f7a7b083d5e8e8659eef4b6d859eaac79adc4cb9100b219c9fb14886362fe","observation_id":"cafffd9b-ee29-49b4-81c8-a09b699277a3","resolution":{"observed_at":"2026-08-07T14:32:32.862069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14023","last_updated":"2024-05-22T21:59:22Z","snapshot_observed_at":"2026-07-06T18:18:12.096996Z","submitted_at":"2024-05-22T21:59:22Z","title":"WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and Response","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14023","snapshot_observed_at":"2026-08-07T14:32:31.393629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.393629Z"},"links":{"cited_paper":"/paper/2405.14023","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:fc2e2849b7c96dae9f7ece0cacc8c94bd9571f4cc6472a3249050fbf7ae61cc8","observation_id":"306dfaa0-926f-4e67-9edb-c8e95cb94cd8","resolution":{"observed_at":"2026-08-07T14:32:31.393629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:32.636107Z","title":null,"venue":null,"work_id":"a4398e31-a24d-472c-963d-ac04376ae620","year":2025},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.465433Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:9bce4974d4e7b884a25a47a211037649c2baa33a4a487194ecbca5d423ea455a","observation_id":"363920a5-7472-43d6-bfb9-c5b14637ff60","resolution":{"observed_at":"2026-08-07T14:32:32.706784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:32:32.429446Z","title":"Autodan: Interpretable gradient-based adversarial attacks on large language models","venue":null,"work_id":"7fff4da6-b5b3-4f82-a75c-ab0647aad04f","year":null},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.558726Z"},"links":{"citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:8bfec9fd293fa661ff63e5c4c76223f5e27af4db882b68e206d9dd6e397c9a18","observation_id":"8c3068a1-aab5-4bc1-8738-4a37c628852f","resolution":{"observed_at":"2026-08-07T14:32:32.486577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T14:32:31.644019Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:31.644019Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:c415b55381c76e8990c9fcd04a251068aeba5d8fdeb65fd815730b71c9d165da","observation_id":"06bbe084-a062-490a-81fd-b9a1ac80b7ae","resolution":{"observed_at":"2026-08-07T14:32:31.644019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 3 inbound Pith citation observations for arXiv:2505.18556."}