{"as_of":"2026-08-07T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:509baa7b7e648272b0525a1ade1f1921664a1b332af82a2f5dba5faa79bc8d60","coverage":[{"denominator":251,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:13:04.217122Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:06:20.077337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T07:05:26.724164Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2602.20102","last_updated":"2026-05-21T18:01:19Z","snapshot_observed_at":"2026-08-02T14:02:01.747985Z","submitted_at":"2026-02-23T18:19:46Z","title":"BarrierSteer: LLM Safety via Learning Barrier Steering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T07:02:03.058731Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2602.20102"},"observation_digest":"sha256:acbe9ee774c09a7dbd02619ab20c4ec97f6ba145976e4884b74bd6c79b8a9dbb","observation_id":"56e7e935-1af9-4a4d-aa2f-86ed48c0b5b6","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2604.11663","last_updated":"2026-04-13T16:11:38Z","snapshot_observed_at":"2026-07-06T22:59:59.220594Z","submitted_at":"2026-04-13T16:11:38Z","title":"Why Do Large Language Models Generate Harmful Content?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:31:13.545599Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2604.11663"},"observation_digest":"sha256:0e49c1c956dcdaa8de7931ce36031fca00750f7f867a4562960caca6314838cc","observation_id":"9b2ca48d-322a-4c1d-9ec2-44a2779397db","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T11:17:19.079380Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:d2c1fb521561dca603effececb585b9c04a077f25c01e49d3967888b63b42704","observation_id":"ee3c235e-d736-4b70-b9b0-507b8df37bea","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T07:53:06.928500Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:873b73a7b6a612cd32ac496952b505defde2a1b108bd095088301026556a8ba3","observation_id":"9c3d6022-748a-4c66-b3d8-d7f6c01daa7a","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2605.14859","last_updated":"2026-05-15T03:53:20Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T14:05:58Z","title":"Do Coding Agents Understand Least-Privilege Authorization?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T16:34:14.379419Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2605.14859"},"observation_digest":"sha256:dceb0ebfe16935f787f6e77f7b55a5e67a1e6094ad753bd138b23e06cd8b52b2","observation_id":"a6083394-f2d9-440b-aa9c-11737631a9ca","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-08-02T07:06:20.077337Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of LLM, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13078","last_updated":"2026-07-12T22:34:02Z","snapshot_observed_at":"2026-08-06T04:19:48.114808Z","submitted_at":"2026-07-12T22:34:02Z","title":"Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:06:20.077337Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2607.13078"},"observation_digest":"sha256:faa64ca9f73fb9c31ec6277e340ef4506522cd4bae58a1988a64648edaf19921","observation_id":"62ac8f37-4f52-40ad-b1cc-44d7042493d1","resolution":{"observed_at":"2026-08-02T07:06:20.077337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05775/citation-record","integrity":"/paper/2508.05775/integrity","json":"/paper/2508.05775/citation-record.json","paper":"/paper/2508.05775"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T23:12:59.700739Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:12:59.700739Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:eec39b52b5d40bbefe4230fbf81382025d41830a0325499015ba51135cf84952","observation_id":"261d18ad-fab4-4f43-9dd3-ecb088b7fbac","resolution":{"observed_at":"2026-08-05T23:12:59.700739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-08-05T23:12:59.802317Z","title":"arXiv preprint arXiv:2309.02705 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:12:59.802317Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:26786ee0a8f550069fe7d5e666f02b63c2e20abdaaf394e4d4b38b4e684ed304","observation_id":"df7a80e7-73ef-4c35-b707-6f4833e9d6b6","resolution":{"observed_at":"2026-08-05T23:12:59.802317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:12:59.919407Z","title":"and Arora, Simran and Mazeika, Manias and Hendrycks, Dan and Lin, Zinan and Cheng, Yu and Koyejo, Sanmi and Song, Dawn and Li, Bo , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T23:12:59.919407Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:6b36c9eaa93daa9e773b5fbb543f14e9921815174fd9247a1cc10c6e9449ae39","observation_id":"47a90b26-9d41-46ec-b784-b65d7cb3fdac","resolution":{"observed_at":"2026-08-05T23:12:59.919407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11507","last_updated":"2023-06-20T12:53:39Z","snapshot_observed_at":"2026-07-06T15:44:35.147343Z","submitted_at":"2023-06-20T12:53:39Z","title":"TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11507","snapshot_observed_at":"2026-08-05T23:13:00.005776Z","title":"arXiv preprint arXiv:2306.11507 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.005776Z"},"links":{"cited_paper":"/paper/2306.11507","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:17c613f591dff0957890247860a7c0f6242221ca5827591384841b2a90a2f0ab","observation_id":"8b639068-14e2-43aa-bcb9-7271a1414879","resolution":{"observed_at":"2026-08-05T23:13:00.005776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.104978Z","title":"Discourse & Society , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.104978Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:25d0779549613295dc439daa6892228c2f1f7d3a04c60401e7cc6a3fcfa16f35","observation_id":"caaf4c2e-3351-4090-8fc0-c064cb0b8f5f","resolution":{"observed_at":"2026-08-05T23:13:00.104978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.181127Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.181127Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:23c6ea927198037322f1bf71ebc5bad39679a1ac69abe01c5b7fd58aa3db6e72","observation_id":"56cbbbe5-c55e-4f2c-a79d-55d70c7ac078","resolution":{"observed_at":"2026-08-05T23:13:00.181127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.321368Z","title":"Proceedings of the 26th International Symposium on Research in Attacks, Intrusions and Defenses , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.321368Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:59722dd0e3795f7812792d922284ebf74d1670db09b60defa00089e44c8bcc4d","observation_id":"31ebaa58-fc08-479b-8ccd-d8f0970e2863","resolution":{"observed_at":"2026-08-05T23:13:00.321368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.411654Z","title":"Findings of the association for computational linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.411654Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:13a60ab363047ff5838ade0f14c6d8a999a36a82a9a9fa26c046a5629b9dbdb0","observation_id":"3024722d-7cfa-4993-86b6-52c8b1367780","resolution":{"observed_at":"2026-08-05T23:13:00.411654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.524651Z","title":"IEEE Transactions on Cognitive and Developmental Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.524651Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1f340039609478fa0885d0905b75a0abe2d34936a117f425d4c9d54fd64fe087","observation_id":"b62dcf92-388f-4ed0-812f-e6cd008e0d32","resolution":{"observed_at":"2026-08-05T23:13:00.524651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.699894Z","title":"Proceedings of the 2022 ACM SIGSAC Conference on Computer and Communications Security , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.699894Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f1c7cca5b53699d6b47a55e6b824ef6bf818ae0ed839aed6fa7f79d2f158f3df","observation_id":"1852a291-a39b-4b13-9bd1-39bd7f229e87","resolution":{"observed_at":"2026-08-05T23:13:00.699894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.793432Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.793432Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f31d5653a6b6ab881bcc67f177d6468b64acac9eeee8d817bd51439490fe4fe5","observation_id":"7bce24a2-e0a2-49ac-ba41-f6ce07a77dcd","resolution":{"observed_at":"2026-08-05T23:13:00.793432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13926","last_updated":"2024-02-21T16:46:36Z","snapshot_observed_at":"2026-08-07T20:27:31.331983Z","submitted_at":"2024-02-21T16:46:36Z","title":"Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13926","snapshot_observed_at":"2026-08-05T23:13:00.922194Z","title":"arXiv preprint arXiv:2402.13926 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.922194Z"},"links":{"cited_paper":"/paper/2402.13926","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:8eb17913065f7d3ff31db592072ac04ca52497d82a2a28438c3ecb6f113a9a0e","observation_id":"588c10bd-6657-46d9-8169-db93e98a0fa8","resolution":{"observed_at":"2026-08-05T23:13:00.922194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11459","last_updated":"2024-10-15T10:07:15Z","snapshot_observed_at":"2026-07-06T19:33:43.723135Z","submitted_at":"2024-10-15T10:07:15Z","title":"Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11459","snapshot_observed_at":"2026-08-05T23:13:01.081890Z","title":"arXiv preprint arXiv:2410.11459 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.081890Z"},"links":{"cited_paper":"/paper/2410.11459","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f596f60b308cab30bad4662aeb661e2d2b1f0290b8ed555b5b43e181273cab09","observation_id":"8cdb97cf-27b1-4e68-9b34-49645946c50e","resolution":{"observed_at":"2026-08-05T23:13:01.081890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.164060Z","title":"Security and Communication Networks , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.164060Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3ec7ba24e70a959166d899ba5734d08a767bf175d233605becafc1c31699e65f","observation_id":"0f7c2101-7c04-434e-bff4-bf7a40f3b1d4","resolution":{"observed_at":"2026-08-05T23:13:01.164060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.264593Z","title":"Proceedings of the First Workshop on Social Influence in Conversations (SICon 2023) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.264593Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:a5d36e91d6fad28d3404c42708a9155805a58ac98c17202431166e9fba79e520","observation_id":"af481b02-ce75-483f-923f-36f1c96e498c","resolution":{"observed_at":"2026-08-05T23:13:01.264593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08487","last_updated":"2023-11-14T19:28:51Z","snapshot_observed_at":"2026-08-04T07:57:38.773202Z","submitted_at":"2023-11-14T19:28:51Z","title":"Alignment is not sufficient to prevent large language models from generating harmful information: A psychoanalytic perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08487","snapshot_observed_at":"2026-08-05T23:13:01.410828Z","title":"arXiv preprint arXiv:2311.08487 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.410828Z"},"links":{"cited_paper":"/paper/2311.08487","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:05b5d5b7f6a1d5821fb207319477f5b5afb3c13361abcefb012a3a78e55e9c65","observation_id":"bc88f121-4999-4919-9bfb-05db88f4f74a","resolution":{"observed_at":"2026-08-05T23:13:01.410828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14003","last_updated":"2023-02-27T17:47:53Z","snapshot_observed_at":"2026-07-06T14:56:23.908982Z","submitted_at":"2023-02-27T17:47:53Z","title":"Systematic Rectification of Language Models via Dead-end Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14003","snapshot_observed_at":"2026-08-05T23:13:01.483650Z","title":"arXiv preprint arXiv:2302.14003 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.483650Z"},"links":{"cited_paper":"/paper/2302.14003","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:5534b3618260bb645b101fd03cdfd2bff5c5e23da23e241d86edbcc55577d374","observation_id":"3be65711-c14d-4c93-828e-947d429cc5fc","resolution":{"observed_at":"2026-08-05T23:13:01.483650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04921","last_updated":"2023-11-03T00:17:08Z","snapshot_observed_at":"2026-07-06T16:44:51.557703Z","submitted_at":"2023-11-03T00:17:08Z","title":"Successor Features for Efficient Multisubject Controlled Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04921","snapshot_observed_at":"2026-08-05T23:13:01.514336Z","title":"arXiv preprint arXiv:2311.04921 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.514336Z"},"links":{"cited_paper":"/paper/2311.04921","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:eb0a02a1f31642897c86cb94082c0693eb066164beec6a6ccc918881cfee37ba","observation_id":"f5f12ff1-141f-460e-8f75-c76ff8b69b78","resolution":{"observed_at":"2026-08-05T23:13:01.514336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19299","last_updated":"2024-05-29T17:26:52Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:26:52Z","title":"Expert-Guided Extinction of Toxic Tokens for Debiased Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19299","snapshot_observed_at":"2026-08-05T23:13:01.555889Z","title":"arXiv preprint arXiv:2405.19299 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.555889Z"},"links":{"cited_paper":"/paper/2405.19299","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:6d2f64068254b458e57168961bbe2a15d07c8d43bc482f7f0481bf9939951f1f","observation_id":"699178a1-2ce7-42cb-8f5a-055746c3e91c","resolution":{"observed_at":"2026-08-05T23:13:01.555889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12900","last_updated":"2024-05-21T16:14:55Z","snapshot_observed_at":"2026-07-06T18:17:25.642584Z","submitted_at":"2024-05-21T16:14:55Z","title":"Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12900","snapshot_observed_at":"2026-08-05T23:13:01.607883Z","title":"arXiv preprint arXiv:2405.12900 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.607883Z"},"links":{"cited_paper":"/paper/2405.12900","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:8ec0c8996085e22cf1ba8e3cc9da456ad4abd3229b52b7888d672436b7c26b81","observation_id":"cfde5f27-fd0a-4007-bba6-ae62fc3df428","resolution":{"observed_at":"2026-08-05T23:13:01.607883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05143","last_updated":"2024-04-08T01:54:28Z","snapshot_observed_at":"2026-08-07T21:47:40.387844Z","submitted_at":"2024-04-08T01:54:28Z","title":"Plug and Play with Prompts: A Prompt Tuning Approach for Controlling Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05143","snapshot_observed_at":"2026-08-05T23:13:01.681830Z","title":"arXiv preprint arXiv:2404.05143 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.681830Z"},"links":{"cited_paper":"/paper/2404.05143","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:701ff1b4005c8ecc80c71f3dde89350cee42e004fcf244c7fcbfbb1a7f98596d","observation_id":"78d438c3-a207-46c7-ae91-31d8267607d5","resolution":{"observed_at":"2026-08-05T23:13:01.681830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.769771Z","title":"2024 IEEE Security and Privacy Workshops (SPW) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.769771Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:9e2a46845a70bf0b2604fb8fd5069eebbc044d7a1ac1a4f620b3e92c52183cc3","observation_id":"1fdd39d6-cfdd-4101-a7fb-caaac4a64647","resolution":{"observed_at":"2026-08-05T23:13:01.769771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.803231Z","title":"I’m fully who I am","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.803231Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:168b62a28bcef5920045439940401e7277a7fbb5070e5050fe83f648f74f818b","observation_id":"32390486-8e5d-4ff5-916e-cbf37a9521c9","resolution":{"observed_at":"2026-08-05T23:13:01.803231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15336","last_updated":"2023-05-24T16:49:51Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T16:49:51Z","title":"From Text to MITRE Techniques: Exploring the Malicious Use of Large Language Models for Generating Cyber Attack Payloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15336","snapshot_observed_at":"2026-08-05T23:13:01.893879Z","title":"arXiv preprint arXiv:2305.15336 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.893879Z"},"links":{"cited_paper":"/paper/2305.15336","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1ad2215cc502b2b4194f66603c0b53c86bc99990917b28c975c70e66dae39392","observation_id":"fed7984b-8f98-4228-b648-4a15ac91245a","resolution":{"observed_at":"2026-08-05T23:13:01.893879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.986502Z","title":"Scientific Reports , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.986502Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:431c4d036a2a5168da31279ff589864bb10e5cb9ef69424389d90afb4dddba82","observation_id":"988ccafc-7a5e-4aaa-8ef2-6504b7d2a28e","resolution":{"observed_at":"2026-08-05T23:13:01.986502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.013049Z","title":"Otolaryngology--Head and Neck Surgery , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.013049Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:7f9cfe5922461ce761e0cfe9307c23d2d798fe84ddeaa04e0997b1f1ba071872","observation_id":"ae41fc50-c3db-4742-887b-f06e3f739fa2","resolution":{"observed_at":"2026-08-05T23:13:02.013049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.039730Z","title":"The 2024 ACM Conference on Fairness, Accountability, and Transparency , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.039730Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:8177c5cfc1da0b9c839cc2d611986bf8c858e2bce75fceb9a3298b90a0590b15","observation_id":"b8bb058e-c906-4d8a-880f-626b48f65a86","resolution":{"observed_at":"2026-08-05T23:13:02.039730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.115290Z","title":"The 2024 ACM Conference on Fairness, Accountability, and Transparency , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.115290Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:a22fa636149e93b384b0ec1cc4515144152ebe407dc34682279f8b123ce25ca9","observation_id":"d56f67aa-6057-4433-8d0b-4a4e33158069","resolution":{"observed_at":"2026-08-05T23:13:02.115290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19497","last_updated":"2024-06-27T19:26:11Z","snapshot_observed_at":"2026-07-06T18:38:09.490968Z","submitted_at":"2024-06-27T19:26:11Z","title":"Inclusivity in Large Language Models: Personality Traits and Gender Bias in Scientific Abstracts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19497","snapshot_observed_at":"2026-08-05T23:13:02.198098Z","title":"arXiv preprint arXiv:2406.19497 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.198098Z"},"links":{"cited_paper":"/paper/2406.19497","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ba71ce40b6c73f57c95530f68c51497769e1d83f4955b7f0a1a40d13ffed5d27","observation_id":"4c0ad005-a921-4062-870c-d34e4c8d7ed4","resolution":{"observed_at":"2026-08-05T23:13:02.198098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01270","last_updated":"2024-09-30T16:39:51Z","snapshot_observed_at":"2026-07-06T18:39:33.461088Z","submitted_at":"2024-07-01T13:21:33Z","title":"The African Woman is Rhythmic and Soulful: An Investigation of Implicit Biases in LLM Open-ended Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01270","snapshot_observed_at":"2026-08-05T23:13:02.239622Z","title":"arXiv preprint arXiv:2407.01270 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.239622Z"},"links":{"cited_paper":"/paper/2407.01270","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:14173b2055d02d374c4920415c107495d2bb43b5de95cc873bd48f925e6037f2","observation_id":"fe70d7f0-6775-42a6-bfbb-7b348e29d36b","resolution":{"observed_at":"2026-08-05T23:13:02.239622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.263456Z","title":"TATuP-Zeitschrift f","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.263456Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3b8d737165750e6a8e198d8e266bcb56026521505ae3224ca558dbef879d06e1","observation_id":"3af60680-828a-4fa1-978f-01de151e4a68","resolution":{"observed_at":"2026-08-05T23:13:02.263456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.311367Z","title":"Gender Bias in Decision-Making with Large Language Models: A Study of Relationship Conflicts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.311367Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:57f83b03abe8c1ba87ad5155d920f1034aa7e18a7f1399b8a3962d7ec5cfed3b","observation_id":"1d570c05-8e04-4d25-a096-1c8596171a84","resolution":{"observed_at":"2026-08-05T23:13:02.311367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.418496Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.418496Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:bb0df2705bc4649d5ac6d23d5322c6d69df5abfba5607566406d5373b10e350a","observation_id":"66a13d2b-461c-4acf-bf25-6351a60fde69","resolution":{"observed_at":"2026-08-05T23:13:02.418496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12505","last_updated":"2023-10-19T06:15:05Z","snapshot_observed_at":"2026-07-06T16:35:27.763870Z","submitted_at":"2023-10-19T06:15:05Z","title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12505","snapshot_observed_at":"2026-08-05T23:13:02.478257Z","title":"arXiv preprint arXiv:2310.12505 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.478257Z"},"links":{"cited_paper":"/paper/2310.12505","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3e67c8d1f826f369bf8515ca0dc5ee694d58fdf486ac28580fd7924d46a3f618","observation_id":"cbef038d-dd7b-4ab2-abae-e276cb072e90","resolution":{"observed_at":"2026-08-05T23:13:02.478257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09132","last_updated":"2024-07-08T12:10:58Z","snapshot_observed_at":"2026-07-06T17:30:00.589378Z","submitted_at":"2024-02-14T12:28:38Z","title":"Exploring the Adversarial Capabilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09132","snapshot_observed_at":"2026-08-05T23:13:02.527686Z","title":"arXiv preprint arXiv:2402.09132 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.527686Z"},"links":{"cited_paper":"/paper/2402.09132","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:d06164aa14d42bdecf18d36f63a5a4cb9e6fcaa0351a6adea1e689e15b624947","observation_id":"b58ed619-db02-496a-ac0b-a68b93782ad9","resolution":{"observed_at":"2026-08-05T23:13:02.527686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06924","last_updated":"2024-06-06T22:58:32Z","snapshot_observed_at":"2026-08-05T22:43:54.622072Z","submitted_at":"2023-12-12T01:39:29Z","title":"Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06924","snapshot_observed_at":"2026-08-05T23:13:02.596616Z","title":"arXiv preprint arXiv:2312.06924 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.596616Z"},"links":{"cited_paper":"/paper/2312.06924","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:db655f0971f9884d82e1cf15587725b1ab6462965fda5eec2c500b70a50f291c","observation_id":"f4f56dd4-36fb-4e56-8077-3db47afe5ee1","resolution":{"observed_at":"2026-08-05T23:13:02.596616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00787","last_updated":"2024-09-01T17:40:04Z","snapshot_observed_at":"2026-07-06T19:08:57.415038Z","submitted_at":"2024-09-01T17:40:04Z","title":"The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00787","snapshot_observed_at":"2026-08-05T23:13:02.685636Z","title":"arXiv preprint arXiv:2409.00787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.685636Z"},"links":{"cited_paper":"/paper/2409.00787","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:fa16a729811442e4214f9582d24769eb04d2fddf4bd8aece8ca8e66087669aa5","observation_id":"485469a0-bdc5-4ccf-80e5-84675f2a08ea","resolution":{"observed_at":"2026-08-05T23:13:02.685636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08776","last_updated":"2024-10-14T15:04:51Z","snapshot_observed_at":"2026-08-04T20:34:49.938131Z","submitted_at":"2024-10-11T12:49:05Z","title":"F2A: An Innovative Approach for Prompt Injection by Utilizing Feign Security Detection Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08776","snapshot_observed_at":"2026-08-05T23:13:02.828938Z","title":"arXiv preprint arXiv:2410.08776 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.828938Z"},"links":{"cited_paper":"/paper/2410.08776","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f05e382aa827f0d982fa0ca12a83f7f949b417e235dbaa77a9ff798db238ed6d","observation_id":"042ae570-0dfa-4358-bcfb-f09ecfaf014c","resolution":{"observed_at":"2026-08-05T23:13:02.828938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.907233Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.907233Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:799e82c43c1ba6ed2436c6b946eb429054ed5307a2df2958b342bcae7d50fc6c","observation_id":"79103127-ed0f-494b-82bf-a8c035d439d7","resolution":{"observed_at":"2026-08-05T23:13:02.907233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.998152Z","title":"NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.998152Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:dc7c16e2e9018ab87aed97c546ce33419af8a54fb853f456268a60272bcf0bdf","observation_id":"ce3e6df4-cdd3-46e3-8ef4-7ed728a81656","resolution":{"observed_at":"2026-08-05T23:13:02.998152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.063808Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.063808Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f5ad20401f5cbafb68ad1ab07a477d21375c2bb7326d21d36891facb652c07c1","observation_id":"40bdc7da-2a16-4037-9803-63721fd03371","resolution":{"observed_at":"2026-08-05T23:13:03.063808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.146442Z","title":"Fifty Shades of Bias","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.146442Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f966c7ab6635ec9e4957bb4b15aceb5d3475815de19a00320156de3e9cedea32","observation_id":"173e19ea-556e-41c7-b0b1-fbe63074ad43","resolution":{"observed_at":"2026-08-05T23:13:03.146442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.198820Z","title":"K o C o S a: K orean Context-aware Sarcasm Detection Dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.198820Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ce2f6f4475982461e1d6ca89c90c4c30971c104f6834aacc9d0c35ecf81537f9","observation_id":"78ea9e60-7d1d-44ab-baff-8594fc267619","resolution":{"observed_at":"2026-08-05T23:13:03.198820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12010","last_updated":"2024-04-18T09:02:45Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T09:02:45Z","title":"ParaFusion: A Large-Scale LLM-Driven English Paraphrase Dataset Infused with High-Quality Lexical and Syntactic Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12010","snapshot_observed_at":"2026-08-05T23:13:03.303646Z","title":"arXiv preprint arXiv:2404.12010 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.303646Z"},"links":{"cited_paper":"/paper/2404.12010","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:b3b0e94a14883d8890b343f79a643992e2018a887ce3aebe33ff5aa9582a6687","observation_id":"0203ae01-2eae-47bf-a360-bd268aa7305e","resolution":{"observed_at":"2026-08-05T23:13:03.303646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.368332Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.368332Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:2b699a4c42f70d5de685a6879844b495ade6ecc40255a93b8a9738f7ca6ef99e","observation_id":"2eb00353-2d98-4488-94c3-cc9b9f61f1b9","resolution":{"observed_at":"2026-08-05T23:13:03.368332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.407488Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.407488Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f912f2445770d085ab535a78a72874c5887214ecd9e88f98268e46b59fe8ec70","observation_id":"7673df10-b083-4358-b07d-637e107f30ab","resolution":{"observed_at":"2026-08-05T23:13:03.407488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14429","last_updated":"2023-10-22T22:25:14Z","snapshot_observed_at":"2026-07-06T16:36:51.110530Z","submitted_at":"2023-10-22T22:25:14Z","title":"Text generation for dataset augmentation in security classification tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14429","snapshot_observed_at":"2026-08-05T23:13:03.471388Z","title":"arXiv preprint arXiv:2310.14429 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.471388Z"},"links":{"cited_paper":"/paper/2310.14429","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:54b3ce03fcb79cffae330e56e5a2a18d126bdc1d2b068ae7e562cff75446b64a","observation_id":"14afb384-feac-4544-b26d-75ad2f90ccbd","resolution":{"observed_at":"2026-08-05T23:13:03.471388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T23:13:03.550174Z","title":"arXiv preprint arXiv:2306.09442 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.550174Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:90e9a298271e95c1ee43c1208e7733bc18b8208f6fb69ddb5c30776a7ea28abf","observation_id":"8fa9f4d3-d632-40d9-a50d-d4ed6826d947","resolution":{"observed_at":"2026-08-05T23:13:03.550174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.580538Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.580538Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:b9e5d30f70e82b0950cf23b78318881c0b88d8f4910ed1d61dc029f1902fe9a3","observation_id":"4b0c8281-d9ad-4be3-88b5-307123e3bc52","resolution":{"observed_at":"2026-08-05T23:13:03.580538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13768","last_updated":"2023-08-26T05:20:58Z","snapshot_observed_at":"2026-07-06T16:10:38.925065Z","submitted_at":"2023-08-26T05:20:58Z","title":"Adversarial Fine-Tuning of Language Models: An Iterative Optimisation Approach for the Generation and Detection of Problematic Content","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13768","snapshot_observed_at":"2026-08-05T23:13:03.657036Z","title":"arXiv preprint arXiv:2308.13768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.657036Z"},"links":{"cited_paper":"/paper/2308.13768","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:48b08cf72ecc575c24a344b271ba9794951f7f69ef201b86b61ccc35b9c278dc","observation_id":"8705ad8d-9cd4-466b-b034-18c9e58deb4f","resolution":{"observed_at":"2026-08-05T23:13:03.657036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00829","last_updated":"2024-02-28T03:40:46Z","snapshot_observed_at":"2026-07-06T17:38:17.853302Z","submitted_at":"2024-02-28T03:40:46Z","title":"TroubleLLM: Align to Red Team Expert","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00829","snapshot_observed_at":"2026-08-05T23:13:03.721737Z","title":"arXiv preprint arXiv:2403.00829 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.721737Z"},"links":{"cited_paper":"/paper/2403.00829","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c888ee0b7cd909e5e4d763bc6e04b36bf2cd5059067a18d466fc6312156c7592","observation_id":"79165f25-f3b1-4ee8-a196-890c4414871e","resolution":{"observed_at":"2026-08-05T23:13:03.721737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18540","last_updated":"2025-02-28T14:49:25Z","snapshot_observed_at":"2026-08-07T03:50:11.725849Z","submitted_at":"2024-05-28T19:16:17Z","title":"Learning diverse attacks on large language models for robust red-teaming and safety tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18540","snapshot_observed_at":"2026-08-05T23:13:03.820155Z","title":"arXiv preprint arXiv:2405.18540 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.820155Z"},"links":{"cited_paper":"/paper/2405.18540","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:6d90622fab415e7ddb2017d1127dfd89aff602ddd8a01a4609139d419e9db0d4","observation_id":"e3620943-fba8-4cdf-8c73-9b0b3674bd14","resolution":{"observed_at":"2026-08-05T23:13:03.820155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.900039Z","title":"Outcome-Constrained Large Language Models for Countering Hate Speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.900039Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0b3e2a33776c9608715ac7a696b4e6511dcd41b3769b4906ec4a5172ddae5dd1","observation_id":"79871108-0d5c-49d3-bc79-dd7c6aee161c","resolution":{"observed_at":"2026-08-05T23:13:03.900039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.984396Z","title":"Proceedings of the CHI Conference on Human Factors in Computing Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.984396Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:8b54f64d7dc0a1da3ee37848b93f592e21e2b843185f29a2dd91bfe8f349442e","observation_id":"7f166ca7-d232-427c-9d3c-aa44f147d535","resolution":{"observed_at":"2026-08-05T23:13:03.984396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.024459Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.024459Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:4604193caa6bda5c3fc461e85896364cfc989ecbb69e96ef9391f48397013450","observation_id":"8545ce46-1cb4-42ac-8900-8c4ca76e4704","resolution":{"observed_at":"2026-08-05T23:13:04.024459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.028618Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.028618Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:e2fcd4f77b7d3ef821ee9d3b2db3cfb1e5130ebd6c900295e4eb343f1711607c","observation_id":"2e9cd479-162b-4609-8a59-504cfcf47563","resolution":{"observed_at":"2026-08-05T23:13:04.028618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03097","last_updated":"2023-05-30T21:52:33Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-05-30T21:52:33Z","title":"Seeing Seeds Beyond Weeds: Green Teaming Generative AI for Beneficial Uses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03097","snapshot_observed_at":"2026-08-05T23:13:04.032739Z","title":"arXiv preprint arXiv:2306.03097 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.032739Z"},"links":{"cited_paper":"/paper/2306.03097","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:31969f1c037abdb36aad51b4d9c7be9e693e2887afb39ac5d04fe80e6488a692","observation_id":"9765cd3b-ca29-4b0b-8c55-9a5c99e9e018","resolution":{"observed_at":"2026-08-05T23:13:04.032739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.037075Z","title":"Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.037075Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:4bd754e50f1930f4e411e636bd22f5cecd28c33b62c57d1a7e2311eb48436512","observation_id":"ffb8d0e4-52c2-4072-94a7-aaa4be383cf5","resolution":{"observed_at":"2026-08-05T23:13:04.037075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10668","last_updated":"2024-08-26T05:27:13Z","snapshot_observed_at":"2026-08-05T06:44:28.577064Z","submitted_at":"2024-08-20T09:11:21Z","title":"Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10668","snapshot_observed_at":"2026-08-05T23:13:04.041425Z","title":"arXiv preprint arXiv:2408.10668 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.041425Z"},"links":{"cited_paper":"/paper/2408.10668","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:82d72180c7e49dcd2db99300fa6187b8a1dadcb0c7698674ba29ae1be8e34b56","observation_id":"a3aa813f-3e0d-4da8-a522-c6652f44ff70","resolution":{"observed_at":"2026-08-05T23:13:04.041425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05587","last_updated":"2024-06-08T22:14:51Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:14:51Z","title":"Creativity Has Left the Chat: The Price of Debiasing Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05587","snapshot_observed_at":"2026-08-05T23:13:04.046627Z","title":"arXiv preprint arXiv:2406.05587 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.046627Z"},"links":{"cited_paper":"/paper/2406.05587","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:8dd9d816b78e19c00ea0870195424c414380c19dfc8c7b1414bd4afc5f6af56b","observation_id":"eb41db75-9280-4d7b-b079-445d4b108a1e","resolution":{"observed_at":"2026-08-05T23:13:04.046627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.050958Z","title":"Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.050958Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:9c3a694450a7320144724751a1493462a28e780fecdb9e0a9e41001997435367","observation_id":"4fb36029-f869-4632-84e2-4798f5ba304c","resolution":{"observed_at":"2026-08-05T23:13:04.050958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.055130Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.055130Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:cd91c2ac9925ec6f0c2f206db79976fadfaaa0ee643dfc848aa4e75105d5244f","observation_id":"7e68a8cf-756a-4b8e-8909-781950102777","resolution":{"observed_at":"2026-08-05T23:13:04.055130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.059034Z","title":"Yale JL & Tech","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.059034Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3e31ad75edaa39977c9c90b938a1846d536cbbc235b328ff47b5f15deaf9cd02","observation_id":"fadb5382-8c1b-4e3f-88e9-d283ed392b10","resolution":{"observed_at":"2026-08-05T23:13:04.059034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.062924Z","title":"Engineering, Technology & Applied Science Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.062924Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0a12ebc84bb79725a23314ce7abab1500461ce184603ec3ef945812947f50f97","observation_id":"7f71c83e-dfd6-4dcf-b82e-b45d171c540b","resolution":{"observed_at":"2026-08-05T23:13:04.062924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.066922Z","title":"Machine-Generated Tweets , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.066922Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:7d6e220b9687f95519d23d0bf99ee4ed711f2e11e217a24848f0c4f58b109757","observation_id":"49673c17-e9d5-4249-9414-3d001d1ff6f3","resolution":{"observed_at":"2026-08-05T23:13:04.066922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.070937Z","title":"Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.070937Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:067786e598e196ac7844e8f6fe0f2048c986789efd2c9f832407784609a3e8cc","observation_id":"a8c6e79f-2a1f-468c-8481-f059a24e2c7b","resolution":{"observed_at":"2026-08-05T23:13:04.070937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.075456Z","title":"International Conference on Computational Science and Its Applications , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.075456Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:34c0e4cc99a609e8d08c4ec654587a1f92c0d9c5f83cd34481acb622522862fe","observation_id":"fa620c31-7410-4c82-ad9c-610d6e605801","resolution":{"observed_at":"2026-08-05T23:13:04.075456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00203","last_updated":"2023-11-01T00:17:11Z","snapshot_observed_at":"2026-08-03T03:25:57.447210Z","submitted_at":"2023-11-01T00:17:11Z","title":"Modeling subjectivity (by Mimicking Annotator Annotation) in toxic comment identification across diverse communities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00203","snapshot_observed_at":"2026-08-05T23:13:04.079715Z","title":"arXiv preprint arXiv:2311.00203 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.079715Z"},"links":{"cited_paper":"/paper/2311.00203","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:6fc614f60c81a1cbceed7f1884df33c30fbb8e8f6052f2a5fa75a557c22f6439","observation_id":"ec361d9f-ec3f-4332-88fd-83b657ee20e4","resolution":{"observed_at":"2026-08-05T23:13:04.079715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.084319Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.084319Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1c6e2c5b1330e77596f7fbfd5eacbd0d4f2007caa6218396a524644b8f834f63","observation_id":"4613330a-9ecb-48f5-bb4f-e743afd3f148","resolution":{"observed_at":"2026-08-05T23:13:04.084319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.088949Z","title":"Regulating Hate Speech Created by Generative AI , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.088949Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:161184211fd5007f1a934fe6addff508db966b04f6fef356085ccb91af645348","observation_id":"baf565a0-4225-4baa-9631-8a37500fc0ce","resolution":{"observed_at":"2026-08-05T23:13:04.088949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05613","last_updated":"2023-01-31T19:37:52Z","snapshot_observed_at":"2026-08-02T19:01:31.606816Z","submitted_at":"2022-12-11T21:56:44Z","title":"A Study of Slang Representation Methods","version":3},"cited_work":{"arxiv_id":"2212.05613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.05613","snapshot_observed_at":"2026-08-05T23:13:08.065313Z","title":"A Study of Slang Representation Methods","venue":"cs.CL","work_id":"d8855c4d-3c29-4fb7-9d76-245261e54994","year":2022},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.092860Z"},"links":{"cited_paper":"/paper/2212.05613","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c89690262e9a22df9528a2f762dd95428abd968c0e28d238ce88d7b6c1f99225","observation_id":"005b5e48-1803-4b5c-a922-4f6a68568577","resolution":{"observed_at":"2026-08-05T23:13:08.069771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10440","last_updated":"2022-12-20T17:14:45Z","snapshot_observed_at":"2026-08-06T20:28:58.663831Z","submitted_at":"2022-12-20T17:14:45Z","title":"Perplexed by Quality: A Perplexity-based Method for Adult and Harmful Content Detection in Multilingual Heterogeneous Web Data","version":1},"cited_work":{"arxiv_id":"2212.10440","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10440","snapshot_observed_at":"2026-08-05T23:13:08.042108Z","title":"Perplexed by Quality: A Perplexity-based Method for Adult and Harmful Content Detection in Multilingual Heterogeneous Web Data","venue":"cs.CL","work_id":"addbb92b-93ab-439d-86c0-b2bbe2ffd7aa","year":2022},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.096997Z"},"links":{"cited_paper":"/paper/2212.10440","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:12a5ee42971f9c51587e6f765d652baa9d4b923769a2cf1a0ee4bcbe2d370022","observation_id":"6f761ee3-f867-44ab-ad42-3032a44c39ae","resolution":{"observed_at":"2026-08-05T23:13:08.047629Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10154","last_updated":"2023-03-16T08:57:14Z","snapshot_observed_at":"2026-07-06T14:32:52.104734Z","submitted_at":"2022-12-20T10:46:40Z","title":"Human-Guided Fair Classification for Natural Language Processing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10154","snapshot_observed_at":"2026-08-05T23:13:04.101234Z","title":"arXiv preprint arXiv:2212.10154 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.101234Z"},"links":{"cited_paper":"/paper/2212.10154","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1ee9cff42418177813d986c0bf6003eeec8f0a4b0532a4b91466b631485772a1","observation_id":"52f71db4-b053-4998-a6a1-ac5e0bbd3db4","resolution":{"observed_at":"2026-08-05T23:13:04.101234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2301.12534","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:08.002052Z","title":"arXiv preprint arXiv:2301.12534 , year=","venue":null,"work_id":"95a33b5b-5f0e-4127-8018-8fc637e18ba5","year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.105543Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:bcfe290a546f5ece372c3cb29da385a16914cb1cad0486925d3ec7fcd2afa15f","observation_id":"65b692fc-8d19-4aab-9192-b7358227d056","resolution":{"observed_at":"2026-08-05T23:13:08.009527Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.109738Z","title":"International Conference on Advances in Social Networks Analysis and Mining , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.109738Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1f818e99cb9081817f90e6ea7e8b45a82b1145e8371467ce1258a3b550177a3f","observation_id":"3042f772-ca5c-4b91-8fcb-c770d6a45a37","resolution":{"observed_at":"2026-08-05T23:13:04.109738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.114159Z","title":"Explicit Toxicity Detection Models with Interactive Visualization , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.114159Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:7ed7fe775d406398f890da0c891d8048e2898a50fb9bd9c9ad8c3432950d2d19","observation_id":"5f7ed78f-2433-4640-90f3-a95f2603ed0a","resolution":{"observed_at":"2026-08-05T23:13:04.114159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02978","last_updated":"2023-06-05T15:50:57Z","snapshot_observed_at":"2026-08-02T10:52:41.437064Z","submitted_at":"2023-06-05T15:50:57Z","title":"Which Argumentative Aspects of Hate Speech in Social Media can be reliably identified?","version":1},"cited_work":{"arxiv_id":"2306.02978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02978","snapshot_observed_at":"2026-08-05T23:13:07.899931Z","title":"Which Argumentative Aspects of Hate Speech in Social Media can be reliably identified?","venue":"cs.CL","work_id":"f2e8f0ce-d89e-4421-a354-f1d49b2d7b65","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.118824Z"},"links":{"cited_paper":"/paper/2306.02978","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:6211ab518c068613d6771435f8a2d15d7e46934cf1ccda4e4f0e92d44eb3784e","observation_id":"164a9473-9137-4419-a9a1-adad34d60acc","resolution":{"observed_at":"2026-08-05T23:13:07.905145Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.123304Z","title":"Proceedings of the Second Workshop on NLP for Positive Impact (NLP4PI) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.123304Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:6941e2d89b11dbff3765033fcd22d22e5ff4c0ea5e4aab9f1b8977e5e7e05878","observation_id":"25099d55-a1e2-4d1b-a80b-f0077fbc4f34","resolution":{"observed_at":"2026-08-05T23:13:04.123304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.127327Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.127327Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:42c523949b1bc954a797c1b1feca61638a76f89da5b437c86d89906ed22583c7","observation_id":"a458cb7d-4282-49cc-bc73-972d9425e3d6","resolution":{"observed_at":"2026-08-05T23:13:04.127327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13098","last_updated":"2023-09-22T15:10:36Z","snapshot_observed_at":"2026-07-06T16:22:34.623387Z","submitted_at":"2023-09-22T15:10:36Z","title":"Topological Data Mapping of Online Hate Speech, Misinformation, and General Mental Health: A Large Language Model Based Study","version":1},"cited_work":{"arxiv_id":"2309.13098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13098","snapshot_observed_at":"2026-08-05T23:13:07.878303Z","title":"Topological Data Mapping of Online Hate Speech, Misinformation, and General Mental Health: A Large Language Model Based Study","venue":"cs.LG","work_id":"49fdb1ae-16dd-4ac4-882a-f09b94ac34b3","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.131563Z"},"links":{"cited_paper":"/paper/2309.13098","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f871fb9de76a128e7ab476d18461121a048cc698c2143cac903052152cfbf2fd","observation_id":"803845f0-f56b-479d-9657-43c8d43a3d27","resolution":{"observed_at":"2026-08-05T23:13:07.883128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10707","last_updated":"2024-06-09T18:22:33Z","snapshot_observed_at":"2026-08-05T18:39:24.298759Z","submitted_at":"2023-10-16T16:18:55Z","title":"Demonstrations Are All You Need: Advancing Offensive Content Paraphrasing using In-Context Learning","version":2},"cited_work":{"arxiv_id":"2310.10707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.10707","snapshot_observed_at":"2026-08-05T23:13:07.857287Z","title":"Demonstrations Are All You Need: Advancing Offensive Content Paraphrasing using In-Context Learning","venue":"cs.CL","work_id":"945b3b42-ee6e-49d5-a2c9-7c1fadd281a1","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.135809Z"},"links":{"cited_paper":"/paper/2310.10707","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0a77ffd06f5509b2eec488e6891b63390eb59e79544e3000bc19b2307143d911","observation_id":"53d99bd2-5e9f-4264-a72f-8f076dcc6532","resolution":{"observed_at":"2026-08-05T23:13:07.861922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.139949Z","title":"Beyond plain toxic: building datasets for detection of flammable topics and inappropriate statements","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.139949Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1c6431bf097d3c94a6d8a90711458f5f4ed474ad43d8709246b4f8a6f2660bb1","observation_id":"d6661e22-6d2c-4b57-b6d2-934321f5527a","resolution":{"observed_at":"2026-08-05T23:13:04.139949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.144250Z","title":"Evaluation of ChatGPT and BERT-based models for Turkish hate speech detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.144250Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:9a96330361efff68878eef8f78fa0ee8d2dcf39d4dfc67caf7f45cff90fb77ab","observation_id":"d9798d37-cc31-433b-a0b5-a14eb29082c5","resolution":{"observed_at":"2026-08-05T23:13:04.144250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13985","last_updated":"2023-10-21T12:18:29Z","snapshot_observed_at":"2026-07-06T16:36:31.511959Z","submitted_at":"2023-10-21T12:18:29Z","title":"HateRephrase: Zero- and Few-Shot Reduction of Hate Intensity in Online Posts using Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.13985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.13985","snapshot_observed_at":"2026-08-05T23:13:07.835389Z","title":"HateRephrase: Zero- and Few-Shot Reduction of Hate Intensity in Online Posts using Large Language Models","venue":"cs.CL","work_id":"d56c1cc7-320e-458e-a20d-33230d3e448d","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.148362Z"},"links":{"cited_paper":"/paper/2310.13985","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1dade84637eb0a5a2751fc26b3b1183b88d05542e87760fea6566f1265bd4f5d","observation_id":"5ec65427-89d8-4191-b8ae-ac3903d98754","resolution":{"observed_at":"2026-08-05T23:13:07.840022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18580","last_updated":"2024-12-23T05:04:49Z","snapshot_observed_at":"2026-07-06T16:55:01.268118Z","submitted_at":"2023-11-30T14:18:47Z","title":"FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18580","snapshot_observed_at":"2026-08-05T23:13:04.152649Z","title":"arXiv preprint arXiv:2311.18580 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.152649Z"},"links":{"cited_paper":"/paper/2311.18580","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:9567c2050c3859217ec9e6b3e3dc9dff3d343ed7ee353e238949657ada103347","observation_id":"10435c6c-a17d-4409-9d63-6408f817ac91","resolution":{"observed_at":"2026-08-05T23:13:04.152649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.157130Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.157130Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:5b3d5af1e26346b77224dcab6e52907fe7e238e55077405b50fbcb45afa9c8f5","observation_id":"302948ef-6193-4c33-911b-47b1b120795a","resolution":{"observed_at":"2026-08-05T23:13:04.157130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T23:13:04.161107Z","title":"arXiv preprint arXiv:2312.06674 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.161107Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:e725c0265709c755d4e1325016ed2cce5aaf4daa0ce24f80e35d51bcb8f8473d","observation_id":"a5365e4f-0f2d-47a2-8d76-5b266eafd26e","resolution":{"observed_at":"2026-08-05T23:13:04.161107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.165543Z","title":"2024 , isbn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.165543Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:277c7a9cd3be81dfdc15f185bac8f32ecfc966289a1e8d6a2b62299b151b6e68","observation_id":"78766c66-76e8-4a0a-9996-8cb3380fc3b7","resolution":{"observed_at":"2026-08-05T23:13:04.165543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14258","last_updated":"2024-02-22T03:46:02Z","snapshot_observed_at":"2026-07-06T17:33:45.647306Z","submitted_at":"2024-02-22T03:46:02Z","title":"Eagle: Ethical Dataset Given from Real Interactions","version":1},"cited_work":{"arxiv_id":"2402.14258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14258","snapshot_observed_at":"2026-08-05T23:13:07.706810Z","title":"Eagle: Ethical Dataset Given from Real Interactions","venue":"cs.CL","work_id":"1645b0cb-ecc7-48c6-9124-266cfc89f814","year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.169918Z"},"links":{"cited_paper":"/paper/2402.14258","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1027b2bf2d9a066d849426ce7dc3870aaafe7bd72cb8a750a97f480321737387","observation_id":"dd78b58d-881b-4fd8-9d82-aad9612a5cf3","resolution":{"observed_at":"2026-08-05T23:13:07.712366Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.174303Z","title":"Proceedings of the first workshop on language technology for equality, diversity and inclusion , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.174303Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:626002abc05f10fd5ecbe4e0b2cdd390190cb657044e909ea2ef20dbdf0dfc00","observation_id":"54e798c2-c413-47ea-bb80-6a08a6c8fc0c","resolution":{"observed_at":"2026-08-05T23:13:04.174303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.178745Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.178745Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c5b1eed0231ea76044f9abf3eef9811a3eee83ee43c18af1aa8a861774ef41f3","observation_id":"54f73beb-ca2e-4f98-b9b6-d76066cfccfe","resolution":{"observed_at":"2026-08-05T23:13:04.178745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.183378Z","title":"M isgender M ender: A Community-Informed Approach to Interventions for Misgendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.183378Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:04d155a81677733cfe21e8da7e226c80b6ab54220d0ac45270a533e6e5827919","observation_id":"34bdbfab-2e6a-4ead-bfb0-5ad5db868f85","resolution":{"observed_at":"2026-08-05T23:13:04.183378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01577","last_updated":"2024-04-26T05:29:35Z","snapshot_observed_at":"2026-08-04T17:33:51.070108Z","submitted_at":"2024-04-26T05:29:35Z","title":"HateTinyLLM : Hate Speech Detection Using Tiny Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01577","snapshot_observed_at":"2026-08-05T23:13:04.187341Z","title":"arXiv preprint arXiv:2405.01577 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.187341Z"},"links":{"cited_paper":"/paper/2405.01577","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:991e3cdfe23dd889db2917bddb332ed9cf3f99814849a88a95b32654bc2174ff","observation_id":"41a2da99-3a2f-442a-9f47-98af30d9b87c","resolution":{"observed_at":"2026-08-05T23:13:04.187341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17841","last_updated":"2024-04-27T09:20:13Z","snapshot_observed_at":"2026-08-06T09:30:47.229505Z","submitted_at":"2024-04-27T09:20:13Z","title":"Toxicity Classification in Ukrainian","version":1},"cited_work":{"arxiv_id":"2404.17841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.17841","snapshot_observed_at":"2026-08-05T23:13:07.670532Z","title":"Toxicity Classification in Ukrainian","venue":"cs.CL","work_id":"76c4f9eb-e202-4725-a1e2-f1dd1a3fd3c4","year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.191642Z"},"links":{"cited_paper":"/paper/2404.17841","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ccd95fd0345ae456c6cea85605dd039911bb8a1f56f9055eb9c3590ca997c432","observation_id":"d422327e-7c3c-459e-9c4c-774677d84c23","resolution":{"observed_at":"2026-08-05T23:13:07.675095Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.196099Z","title":"Proceedings of the International AAAI Conference on Web and Social Media , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.196099Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:060b71b36a39f5f4763f80d5402783b69f5573b877deb9cd295fad83a00e8d96","observation_id":"b7910204-72e1-4448-a7f3-d09091fa36b5","resolution":{"observed_at":"2026-08-05T23:13:04.196099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.200044Z","title":"Proceedings of the International AAAI Conference on Web and Social Media , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.200044Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c662c768d74be54d6ae0e27025463d7e72d24dce939c6d73f02a4323a5e95b5f","observation_id":"2fae51d7-23e7-4aef-aae7-40ffa4c11406","resolution":{"observed_at":"2026-08-05T23:13:04.200044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.204022Z","title":"Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics: Student Research Workshop , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.204022Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:426150709e4ddbe13010e3eac5829676aaaf8ae9dea1f4d03fc0d8be2d82d67c","observation_id":"ea2dfb9d-e2ee-4ff1-b6a5-f35c656b1f1a","resolution":{"observed_at":"2026-08-05T23:13:04.204022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15227","last_updated":"2024-07-21T17:27:17Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-21T17:27:17Z","title":"A Community-Centric Perspective for Characterizing and Detecting Anti-Asian Violence-Provoking Speech","version":1},"cited_work":{"arxiv_id":"2407.15227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15227","snapshot_observed_at":"2026-08-05T23:13:07.648272Z","title":"A Community-Centric Perspective for Characterizing and Detecting Anti-Asian Violence-Provoking Speech","venue":"cs.CL","work_id":"95071270-0bed-4c90-a5ad-a61f28be96ef","year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.208197Z"},"links":{"cited_paper":"/paper/2407.15227","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:576ece17462f8b0b8cdc4759d866187ef2b706ba86e752725f13d55e5c3fe9af","observation_id":"0e70d85c-1aa2-4384-84c5-2ffbfd12e9b8","resolution":{"observed_at":"2026-08-05T23:13:07.653077Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.213203Z","title":"and Saha, Sriparna and Pasupa, Kitsuchart , title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.213203Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:dc79f31f6c39384c3391c80dcd47b1f71e82d22b05ced384816c0876d062ce05","observation_id":"fc7888dc-7bf9-4d8b-8bba-3b06a2bb1d91","resolution":{"observed_at":"2026-08-05T23:13:04.213203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10414","last_updated":"2025-02-23T10:12:38Z","snapshot_observed_at":"2026-07-06T19:33:00.110753Z","submitted_at":"2024-10-14T12:04:06Z","title":"On Calibration of LLM-based Guard Models for Reliable Content Moderation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10414","snapshot_observed_at":"2026-08-05T23:13:04.217122Z","title":"arXiv preprint arXiv:2410.10414 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.217122Z"},"links":{"cited_paper":"/paper/2410.10414","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:83f27f1a6c1507b17340e6f6c0ff1524229c2d793f5514e3d6bd8d8b23bff7a0","observation_id":"35c4bcef-1500-4a11-a17b-48205080ce62","resolution":{"observed_at":"2026-08-05T23:13:04.217122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":90,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":251},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 251 outbound references and 6 inbound Pith citation observations for arXiv:2508.05775."}