{"as_of":"2026-08-08T16:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51469a28c9b5c2988d6f522d96280bbe56e9497c8a298943c58e4d73959790d1","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:40:31.250299Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.12672/citation-record","integrity":"/paper/2509.12672/integrity","json":"/paper/2509.12672/citation-record.json","paper":"/paper/2509.12672"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.116422Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.116422Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:6d4377fe1150d700549cda5af61dfea4856ce437c574e9531cdabae176f948ad","observation_id":"618cc52e-9b6b-4065-b6ed-9e5c3d55ef56","resolution":{"observed_at":"2026-08-04T16:40:31.116422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.120087Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.120087Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:ad7452c7c30c9ce768453a2c3e7bd32f38c04530268329b7a5c3792ec370dc84","observation_id":"46cdf308-c29a-430e-aa6a-821fff51889b","resolution":{"observed_at":"2026-08-04T16:40:31.120087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.123713Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.123713Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:e9bff5967d617df9c1d1e01e90caddb60ff216860e77a9857d35beac8aaef52c","observation_id":"d3614bcb-5916-431c-86c4-dcebb732c7e2","resolution":{"observed_at":"2026-08-04T16:40:31.123713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.126880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.126880Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:551b4bb36f786e546245d490ac29cdd2c412c8ec245fc3cdd89912e94512f82e","observation_id":"6bc19f82-69af-4133-aee9-b35823587b2e","resolution":{"observed_at":"2026-08-04T16:40:31.126880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-04T16:40:31.129847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.129847Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:8ce222c862705dfbd00c3fb34f9d23ad61c6b9ad5f3b1a42cdc41aea0391e758","observation_id":"b74c5b7a-dd7d-4c18-81a7-a2f8c38e83cc","resolution":{"observed_at":"2026-08-04T16:40:31.129847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08690","last_updated":"2024-04-09T22:56:05Z","snapshot_observed_at":"2026-07-06T17:59:33.719350Z","submitted_at":"2024-04-09T22:56:05Z","title":"Towards Building a Robust Toxicity Predictor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08690","snapshot_observed_at":"2026-08-04T16:40:31.133163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.133163Z"},"links":{"cited_paper":"/paper/2404.08690","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:acb8091f3db757ace06e3ed04aceac90dd2118916282e2fb03907cd791fc0d8c","observation_id":"072c8864-8fc0-4f1c-94cf-4981912c04ea","resolution":{"observed_at":"2026-08-04T16:40:31.133163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.136971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.136971Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:b2e1ca5a0cb1361460658fad55551e33f59bb9555ce335890009442a52785add","observation_id":"247f0cce-2568-4a35-a002-e7f5d21532c6","resolution":{"observed_at":"2026-08-04T16:40:31.136971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.140263Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.140263Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:099bffba67ab87911a0ceb24309fb8acaa28aa9165554e2020d8806e0c42ea91","observation_id":"38b51520-2d7a-4a6f-9c57-3c6830720a52","resolution":{"observed_at":"2026-08-04T16:40:31.140263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.143456Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.143456Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:81a3b16252fdde7f2983fc96d0dc6fe01a66ce8be220fb30c68db3d680553b70","observation_id":"1390aade-ade4-4013-b84e-7deb1b97cd2f","resolution":{"observed_at":"2026-08-04T16:40:31.143456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.146244Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.146244Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:1ed0817cfc8641a23dd2e08acb1fb7c734b3cf6ee5810a64d28da3287f4ae546","observation_id":"a1e91bfd-b394-45b8-af01-0d6b5052dbca","resolution":{"observed_at":"2026-08-04T16:40:31.146244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14997","last_updated":"2023-10-28T20:05:52Z","snapshot_observed_at":"2026-07-06T15:21:19.790554Z","submitted_at":"2023-04-28T17:36:53Z","title":"Towards Automated Circuit Discovery for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14997","snapshot_observed_at":"2026-08-04T16:40:31.149122Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.149122Z"},"links":{"cited_paper":"/paper/2304.14997","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:ecd09195eb81975c6520d6ac1e1a9e91944d4ad4402b96c65b8e7bbd7361b8e8","observation_id":"7e2e582d-84cf-4b6f-af44-3536a0ba7fa2","resolution":{"observed_at":"2026-08-04T16:40:31.149122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T16:40:31.153001Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.153001Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:472941ff11b15524fedecd1d4370d4c005902dd9e65fa0af85adcb532170cbab","observation_id":"1133c7a5-f396-47a1-9fb7-8b5b823790ba","resolution":{"observed_at":"2026-08-04T16:40:31.153001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.156541Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.156541Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:6cb606368f73f3bd35957824b3f2463f50406a101b6c425961dba21132b81e87","observation_id":"8163cfac-a653-45b1-8e2d-aaa7b94838d6","resolution":{"observed_at":"2026-08-04T16:40:31.156541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.159467Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.159467Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:c10be98a64a5576c6092cddc961766b6503c7e45f38868817bea68f4f73ddb4e","observation_id":"a59922d2-4c9d-4813-8857-b2829dc5399b","resolution":{"observed_at":"2026-08-04T16:40:31.159467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.162193Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.162193Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:521d7f97c9e18f082180fa528a736fd5bca6dfa3d90397a1942b4b7442f7a49d","observation_id":"5aaad299-99cd-4808-9824-4eb97b536c99","resolution":{"observed_at":"2026-08-04T16:40:31.162193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.165692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.165692Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:2aea2cacbb8cfe270d1de944554567a08ee9345e03da94e4614d350a4e41ef64","observation_id":"140d4b5f-71ba-4710-b87a-debafd5c72a4","resolution":{"observed_at":"2026-08-04T16:40:31.165692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.168451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.168451Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:e2499d11e3641953b8b970824f1b7aa9aa055f6a4e2f97daa658b7846988f534","observation_id":"af396301-d35d-4ef6-a04d-098c5fb597c9","resolution":{"observed_at":"2026-08-04T16:40:31.168451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.171648Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.171648Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:780d94d97e4bab00849625d9c04bea397dc61d5809e5b6925e3392e9da818ef3","observation_id":"94337268-ddd3-4ed5-bd4a-6ba7e201cbd3","resolution":{"observed_at":"2026-08-04T16:40:31.171648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.174811Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.174811Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:9b8fe2ddd1aac6d327276fc97b13c17b62f994c773541fda9b0cc526693e7af5","observation_id":"26eea721-1a69-4a69-a7b5-ac85284641c2","resolution":{"observed_at":"2026-08-04T16:40:31.174811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.178582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.178582Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:f20eeab233523827024a5af9c51324832adee8fcfb1b7af1f70ffe60440cf5e0","observation_id":"50d3bb49-f4db-49aa-92d6-7022dbbacd81","resolution":{"observed_at":"2026-08-04T16:40:31.178582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.181797Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.181797Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:61242c8c67db9729cb2dc922fc9ef62b67176cf5b4813df28348102875d07beb","observation_id":"cc9cd95e-1d06-44e1-9fe2-c423bae08b88","resolution":{"observed_at":"2026-08-04T16:40:31.181797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.184837Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.184837Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:32a1bbfd3ed5da329a008f8a2ec821f700571bd31a8cd4bd3aaf0faa586b9a65","observation_id":"cf8c2438-d63d-4082-803e-d1245e896c3f","resolution":{"observed_at":"2026-08-04T16:40:31.184837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11176","last_updated":"2022-02-22T20:55:31Z","snapshot_observed_at":"2026-07-06T12:40:33.479618Z","submitted_at":"2022-02-22T20:55:31Z","title":"A New Generation of Perspective API: Efficient Multilingual Character-level Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11176","snapshot_observed_at":"2026-08-04T16:40:31.187575Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.187575Z"},"links":{"cited_paper":"/paper/2202.11176","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:a543619716ebb4559c8221556c7ab976d89be6a36b8d2d0a9b6de89610a99c5b","observation_id":"a04ecd64-ce82-4bcb-b222-78843b17a1a3","resolution":{"observed_at":"2026-08-04T16:40:31.187575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.190708Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.190708Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:82fb7d8d32660e0c673594bcc0d55df6be66efce046c8c9cde1f3342154c4a04","observation_id":"63aee8c0-e72c-4077-a558-d254dc22d77c","resolution":{"observed_at":"2026-08-04T16:40:31.190708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.193428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.193428Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:8e2f51069d5cc999dbcf0a21977b75452bc826d3283186bf5eae4ee1e10e45fe","observation_id":"1a99733c-38c0-447e-aaf8-0988630fe711","resolution":{"observed_at":"2026-08-04T16:40:31.193428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.196217Z","title":"D.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.196217Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:beb08cc780f5769b1526b3756cfe140571efd477166c19146738993200eaaf4d","observation_id":"c8773139-94a8-4f6e-a960-35935bf51f31","resolution":{"observed_at":"2026-08-04T16:40:31.196217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.198929Z","title":"R.; Li, G.; and Crespi, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.198929Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:bb32e9ce212e580f1095a58a7b704efcbfe332cfcf65db844097fd4828ab4892","observation_id":"b20839b2-68a0-4c99-9fbe-5a70fe119bb5","resolution":{"observed_at":"2026-08-04T16:40:31.198929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.202127Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.202127Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:1adf86122738a1992897f0cebce59a0908d0fdaf18e5598ad104e54d619a1268","observation_id":"1ff28abf-a7b1-45b6-8beb-025ff87e9613","resolution":{"observed_at":"2026-08-04T16:40:31.202127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.204983Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.204983Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:521fc59d800a4230338f59215b7ea6c3aa87a343978b9c54adab716f5ab42e2f","observation_id":"8b40be0b-e29d-4760-b373-2f63355c226f","resolution":{"observed_at":"2026-08-04T16:40:31.204983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.207748Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.207748Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:9c5ff21307696aac5797557dded0b1a6beb877c757b303cd7c9759d721655d69","observation_id":"ad8a4e2f-5d17-4a7f-9ef6-42f3e805f4a1","resolution":{"observed_at":"2026-08-04T16:40:31.207748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.210447Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.210447Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:dd37999843db3f62156dbbbeab7a06b1d4f0598f8d3e3bc7cd5e5681072237dc","observation_id":"e1b7ddb6-f539-44e8-a6dd-12d2629bb605","resolution":{"observed_at":"2026-08-04T16:40:31.210447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.213577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.213577Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:56a8a3ecc0fed2722262c578c7b2e4c0758cc40f9018d72a09f45396a1b228e0","observation_id":"293bf6f3-d479-4531-a742-f2abe67f3e14","resolution":{"observed_at":"2026-08-04T16:40:31.213577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00676","last_updated":"2024-01-07T08:00:31Z","snapshot_observed_at":"2026-07-06T10:45:25.470831Z","submitted_at":"2021-03-01T01:00:09Z","title":"Token-Modification Adversarial Attacks for Natural Language Processing: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00676","snapshot_observed_at":"2026-08-04T16:40:31.216119Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.216119Z"},"links":{"cited_paper":"/paper/2103.00676","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:f65b201700ee77b169570f9d0b00bde3c947d021b4df275c983345178aec8f63","observation_id":"f0ec7491-8aa0-4f1d-8f17-166cf60effcd","resolution":{"observed_at":"2026-08-04T16:40:31.216119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.219115Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.219115Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:16fa1b248b24080e1ff9271ef795c061772e09b55f2f3df98fc6c942a2b87a33","observation_id":"cce6712f-334d-4d41-9a63-1f8030cf7501","resolution":{"observed_at":"2026-08-04T16:40:31.219115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.222044Z","title":"o ck, F.; and Wagner, C. 2021. “Call me sexist, but","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.222044Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:19d4f37700bec58aee6fa4de4a0bf6701353f60a8b625e993c49a116e9b03d44","observation_id":"8aaaba9b-adf5-48c8-a93f-43ac7d596243","resolution":{"observed_at":"2026-08-04T16:40:31.222044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18226","last_updated":"2025-03-11T08:08:05Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-26T11:07:25Z","title":"HowkGPT: Investigating the Detection of ChatGPT-generated University Student Homework through Context-Aware Perplexity Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18226","snapshot_observed_at":"2026-08-04T16:40:31.225010Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.225010Z"},"links":{"cited_paper":"/paper/2305.18226","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:96d58f490723872b05d2a789ac09d5b1f0a0c5218b04c4e665ddd4fc14e9e95d","observation_id":"a2ae48b7-6b5d-4803-9419-1809e0dcd2f0","resolution":{"observed_at":"2026-08-04T16:40:31.225010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21073","last_updated":"2024-07-29T09:07:29Z","snapshot_observed_at":"2026-08-05T09:55:43.398103Z","submitted_at":"2024-07-29T09:07:29Z","title":"Enhancing Adversarial Text Attacks on BERT Models with Projected Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21073","snapshot_observed_at":"2026-08-04T16:40:31.227672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.227672Z"},"links":{"cited_paper":"/paper/2407.21073","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:eb31ef84be2d5734ce81f21f516481b7ff8e8281c47e7d4c8e57261129d643ef","observation_id":"86ca1c4e-0812-4f9a-83dd-4a60ca6afa21","resolution":{"observed_at":"2026-08-04T16:40:31.227672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-04T16:40:31.230569Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.230569Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:87a80923aad38bd4b86f49ba7a21625086859f47c9928b7c3b5d20fae9b786b1","observation_id":"4b27728d-2133-4603-9263-342399895f24","resolution":{"observed_at":"2026-08-04T16:40:31.230569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.233207Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.233207Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:1d0a803eba017f38f29a4012ee7d95d34a4097a9fd5970c8911f36a0a0f25b77","observation_id":"e72fdbae-b950-4752-92da-431093f8e751","resolution":{"observed_at":"2026-08-04T16:40:31.233207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.235984Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.235984Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:e15e3f8556948e62145fac98cf47292ba5d821669ac4f03e6cd7a4e645164581","observation_id":"7b88280b-d6f3-4674-a4ee-071c97d11a47","resolution":{"observed_at":"2026-08-04T16:40:31.235984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.238745Z","title":"S.; and Wong, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.238745Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:7a8988cc19cf5dd6194b3ca45cae35cd769cf546f852064e0921ec1a92b2d5d8","observation_id":"25799df4-b1cf-4a0a-8220-d889315bb4c5","resolution":{"observed_at":"2026-08-04T16:40:31.238745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.241698Z","title":"S.; and Wong, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.241698Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:890224ce16a028bbd48105fcc1fa74dc2ca96e6bf79387b6b8adeb46567778c7","observation_id":"d9849187-ef1a-42d2-ac4e-7c51ab90eeae","resolution":{"observed_at":"2026-08-04T16:40:31.241698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.244420Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.244420Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:7cba116c284175ba609b1831e58272beec344638e8a5f819d5ee3c577122010b","observation_id":"1fd0ebd5-059c-4277-aa79-70989e890b6a","resolution":{"observed_at":"2026-08-04T16:40:31.244420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.247794Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.247794Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:e8bd53b9bfe19ab43f37726c9c306470a734adf2b83cc0df4cd4a5a5ecd2287c","observation_id":"f925dcdf-a08b-4a7c-8316-fda551ff1c15","resolution":{"observed_at":"2026-08-04T16:40:31.247794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.250299Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.250299Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:eafe23f6acabc62c4d014139da28e54bb085fb3f6a118dab4df6c9f136d24bdb","observation_id":"cc5dfd60-e7b4-4b2a-9700-f45348ff631c","resolution":{"observed_at":"2026-08-04T16:40:31.250299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:27:35.075316Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2509.12672."}