{"as_of":"2026-08-11T14:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf47f540ebc97e6995c2fd9390c534c4bb014e5b24acd125c0d142ce4b2f9023","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:19:48.082702Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:41:54.081628Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:05:50.801220Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"cited_work":{"arxiv_id":"2501.13302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13302","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d7484b8a-f1b0-4283-8647-605c33f546df","year":2025},"citing_paper":{"arxiv_id":"2604.06552","last_updated":"2026-04-08T01:02:54Z","snapshot_observed_at":"2026-08-11T12:44:17.982245Z","submitted_at":"2026-04-08T01:02:54Z","title":"To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T18:41:54.081628Z"},"links":{"cited_paper":"/paper/2501.13302","citing_paper":"/paper/2604.06552"},"observation_digest":"sha256:31589aa9799c411e16b222bfb042d1e780426a2955885ca5860b2efd8604325b","observation_id":"cae08519-4457-440f-886f-b526fbb18938","resolution":{"observed_at":"2026-05-11T00:05:50.803437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13302/citation-record","integrity":"/paper/2501.13302/integrity","json":"/paper/2501.13302/citation-record.json","paper":"/paper/2501.13302"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T16:19:47.910889Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.910889Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:b645c197ac23bc2532966e82a03c7e0d868337317bd7407b97c3fb7159323e8f","observation_id":"957accdd-a6af-408f-9936-4feae9a131a4","resolution":{"observed_at":"2026-08-10T16:19:47.910889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-10T16:19:47.915189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.915189Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:57f05c888441054de23279e407bf85b38490aa72eddb041455488361bd0c5a7b","observation_id":"994b7894-04d6-4678-b01f-86d99dcb43e4","resolution":{"observed_at":"2026-08-10T16:19:47.915189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.551287Z","title":null,"venue":null,"work_id":"a8fb5aba-15e5-43b4-8aa6-9f7d72c2edab","year":2018},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.919481Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:0727b7b5c86d4672fd17da8629956887e16af3a03b96392698ae44c4c8538eed","observation_id":"fdf210e6-af58-4c6f-9439-bbbd01208ec2","resolution":{"observed_at":"2026-08-10T16:19:48.555144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.539095Z","title":null,"venue":null,"work_id":"8e336799-07ac-4791-8650-6b70f85fc361","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.923447Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:28ec64e41c928b5af84981c2b5ad4d100a843fe14d6e7c7a21aad5cb5b5b4130","observation_id":"b387d232-52ee-40ff-98bc-53a7a506ca64","resolution":{"observed_at":"2026-08-10T16:19:48.543327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18932","last_updated":"2024-03-27T18:22:48Z","snapshot_observed_at":"2026-07-06T17:52:13.812196Z","submitted_at":"2024-03-27T18:22:48Z","title":"Measuring Political Bias in Large Language Models: What Is Said and How It Is Said","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18932","snapshot_observed_at":"2026-08-10T16:19:47.927230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.927230Z"},"links":{"cited_paper":"/paper/2403.18932","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:913b0bf1047c2f2c62cba5ea7b4bb5852cd076a3f046e3ce8cb14861dff8bad6","observation_id":"94bda893-9bd1-4600-a460-f0db83ae7d79","resolution":{"observed_at":"2026-08-10T16:19:47.927230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.527053Z","title":null,"venue":null,"work_id":"91f4ca94-39eb-4b6d-ab7f-b58db3d5060d","year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.931343Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:cc37430112b7b5041397243f8c43b6780b2328651287258f071898209f8762a8","observation_id":"6f5ed728-a3d1-4782-85af-0560f4be0bde","resolution":{"observed_at":"2026-08-10T16:19:48.531178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00897","last_updated":"2024-05-04T00:33:06Z","snapshot_observed_at":"2026-07-31T08:43:52.761839Z","submitted_at":"2024-04-01T03:49:42Z","title":"Machine Learning Robustness: A Primer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00897","snapshot_observed_at":"2026-08-10T16:19:47.935427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.935427Z"},"links":{"cited_paper":"/paper/2404.00897","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:c1d68e00c1f11575a56f1a7d6f757d0bf46b2077c280952bbbed43f8a9126a7a","observation_id":"6aaee4bf-019f-4f79-b7d8-6cd9bc434e03","resolution":{"observed_at":"2026-08-10T16:19:47.935427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.939518Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.939518Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:46128a7ed8f85c14f67b828f3c3854a538ec4b9b6ec54f528ab51b46b4c329fa","observation_id":"40ba0447-1e27-4fa7-986e-7cfc3f37fe33","resolution":{"observed_at":"2026-08-10T16:19:47.939518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.507777Z","title":null,"venue":null,"work_id":"8bc80196-25a6-4a26-b42a-2f213d1e42e7","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.942816Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:b66a5be6be48adeb71f918110d7c44d7b5dd8f01e4fed0b85ae623da05915f58","observation_id":"b9a4ae2d-2986-44c0-86ae-2c1bfcfde9ab","resolution":{"observed_at":"2026-08-10T16:19:48.511482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.495281Z","title":null,"venue":null,"work_id":"8ca9f4f2-8cd0-411b-a12a-6a683d593fac","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.946449Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:2db26b1283d714d68020bed2c6caaf82742e13c7f05e6a0a77e4a7ea1e98b983","observation_id":"5f466b0d-35e0-453c-9b36-1ab2527b282c","resolution":{"observed_at":"2026-08-10T16:19:48.499247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.483148Z","title":null,"venue":null,"work_id":"30005a5c-c288-4e98-88f3-ab9dfc2206d4","year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.949889Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:83388f9b142723d3df031669fb3c7a103131ba90207a430774caafdadc917198","observation_id":"6d38a130-b64e-4e27-bce1-906b147fc153","resolution":{"observed_at":"2026-08-10T16:19:48.486852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.471240Z","title":"what data benefits my classifier?","venue":null,"work_id":"f81b36d0-26b2-41b6-ac7a-a9e75cb38262","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.953417Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:5520608c017b857258dd99dd609eeb71e37d015130dd30fb4beb9c611a6639d5","observation_id":"6d49dfe9-edeb-466e-88ca-990fdb6f3091","resolution":{"observed_at":"2026-08-10T16:19:48.475115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.459733Z","title":null,"venue":null,"work_id":"a98ed67c-6072-433d-91c9-906a59eeba4b","year":2021},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.956787Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:bf40ccb128cd7d1b23530f2c52d95f6f584dde5fe01b5e4f17cf9e9bff6c1b63","observation_id":"01d6af94-8c05-4917-8193-7f0a93522893","resolution":{"observed_at":"2026-08-10T16:19:48.463442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.447706Z","title":"Towards F air V ideo S ummarization","venue":null,"work_id":"4a7eee0f-f20d-41af-9040-63050d3f8a18","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.960199Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:8eaaa20e9090f8e8c238b79948aa313473c8f0ebbdc87f6cf9e1d3287c65c6fd","observation_id":"0b158943-e49e-4194-a188-d673ef496a69","resolution":{"observed_at":"2026-08-10T16:19:48.451843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.435504Z","title":"https://clarifai.com/clarifai/main/models/moderation-english-text-classification","venue":null,"work_id":"6fea6a83-bd10-4694-8f36-8c1b32314ba1","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.963889Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:50c7cfcb84e3dc3e6bcabd42bbd4114206e25b1b5244bc99a100f555ca6b4c75","observation_id":"469152dd-23c9-4741-bc33-b57b8f86194a","resolution":{"observed_at":"2026-08-10T16:19:48.439695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.967288Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.967288Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:2fe0d4dfa3faff451fd06052403dc8d9528c0b4a269516432175fd81df1ddad8","observation_id":"833e1be4-6313-4157-b8b2-71756fda40d8","resolution":{"observed_at":"2026-08-10T16:19:47.967288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.416963Z","title":null,"venue":null,"work_id":"1ea58af4-42e5-4371-ac2a-7946e4a2f6cc","year":2017},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.970743Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:52891a7f48591a8f0bf6dee9d6e95c764807e6f159d834fd5cd2bd694f834638","observation_id":"7eb2e53b-6f52-4a39-9029-3be0d4989878","resolution":{"observed_at":"2026-08-10T16:19:48.420477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.974101Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.974101Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:4d1b77fa223562c8a3accc3caf442be1e97a5a254a87849e38b2fed5867dcf01","observation_id":"37171bea-4513-4777-a01f-b934a5d8eb45","resolution":{"observed_at":"2026-08-10T16:19:47.974101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.977419Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.977419Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:e972ac2b95b165ea93a3074811c8f0aad6515c6ae84220ce645fed66b0af3e42","observation_id":"4e01e04b-652c-40d9-b9fe-89ec5d468370","resolution":{"observed_at":"2026-08-10T16:19:47.977419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01822","last_updated":"2024-05-29T12:57:01Z","snapshot_observed_at":"2026-08-05T10:31:48.540037Z","submitted_at":"2024-02-02T16:35:00Z","title":"Building Guardrails for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01822","snapshot_observed_at":"2026-08-10T16:19:47.980860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.980860Z"},"links":{"cited_paper":"/paper/2402.01822","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:30d2d5a843d17bfc7cb6dbe8d7cf1b984482fef0005f3218b6f353c0ffb35738","observation_id":"fd54c1ef-1759-49df-99fb-9369e50a2a02","resolution":{"observed_at":"2026-08-10T16:19:47.980860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16388","last_updated":"2024-04-12T00:05:53Z","snapshot_observed_at":"2026-07-30T00:01:16.818092Z","submitted_at":"2023-06-28T17:31:53Z","title":"Towards Measuring the Representation of Subjective Global Opinions in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16388","snapshot_observed_at":"2026-08-10T16:19:47.984874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.984874Z"},"links":{"cited_paper":"/paper/2306.16388","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:abef9ece5df84b5b042559ddb7f24326b846d29b5cbeedb741934854375f84b1","observation_id":"1c56b1aa-31a9-4a15-ab87-aa275dbc12f6","resolution":{"observed_at":"2026-08-10T16:19:47.984874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.988841Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.988841Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:8d98ba1bfee1299701ed92191c77ae85360dc9f88bd167d43638a8a89d2c5588","observation_id":"ffe43d74-258e-45a0-ba09-5ebafb5619d2","resolution":{"observed_at":"2026-08-10T16:19:47.988841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-10T16:19:47.992480Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.992480Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:57db7b302c2c00953701004528c31c3a663590417d94bb77b748312475e906fc","observation_id":"40265bf1-2d53-4cea-b645-f9dc54041843","resolution":{"observed_at":"2026-08-10T16:19:47.992480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.385787Z","title":null,"venue":null,"work_id":"6b1ffb57-8444-43e6-838e-00ba3009fa33","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.996348Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:373cd848fabd0b86a2b3d240650bdc1a3123957fb986d81136375148c52f7e80","observation_id":"4f7fc283-4ac4-4a98-8f4a-69a3027413e7","resolution":{"observed_at":"2026-08-10T16:19:48.389553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.374454Z","title":null,"venue":null,"work_id":"576757e1-3f3e-47b4-b037-05662da6aa65","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.999917Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:7ae95e560cee53139714f6a128b63528c15ba8eff5321814e206a264775094f6","observation_id":"3120bf2e-c8d9-4288-96e8-ce3b560ca2d2","resolution":{"observed_at":"2026-08-10T16:19:48.378264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-10T16:19:48.003786Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.003786Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:4017c30efef61a52fae719bc43bbb1d38d8e0d3cfb1b29a538ce674b14f5bc6e","observation_id":"b5a3957c-06e0-43b3-a3ec-8e97510de234","resolution":{"observed_at":"2026-08-10T16:19:48.003786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.363071Z","title":null,"venue":null,"work_id":"d41ecb76-74ee-4ee6-a55f-5c028084ec0f","year":2020},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.007666Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:7fcb55c1d62767a20064ad5483f0470ef58986f1181fde879cd1be176eb40a22","observation_id":"c3e0b635-8d6d-444f-89b2-965b6abd3673","resolution":{"observed_at":"2026-08-10T16:19:48.367010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.011118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.011118Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:ebd31800053b80debe5e65973d02aac757a1d35295d7856aae6368b80060c613","observation_id":"d24dd804-9b07-43ef-b486-3422c813e1bc","resolution":{"observed_at":"2026-08-10T16:19:48.011118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.345232Z","title":null,"venue":null,"work_id":"a6780110-3583-4b17-b7c0-c8f1e47a17fd","year":2017},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.014641Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:9d2ee1723b78cb62419f8dcce40d6c66b85d909e99bbac78572ede9e61b9877f","observation_id":"9f120699-f8b7-414f-992a-24852e974628","resolution":{"observed_at":"2026-08-10T16:19:48.349006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.334055Z","title":null,"venue":null,"work_id":"8d1cbfa8-0e78-4941-9a73-31c79f83e0a4","year":2022},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.018074Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:33df7fdad455477d8ff4280a3f8b55ac9efcbb5377ef354bf24681bdf00ec20b","observation_id":"3b0804cd-4ab9-4b74-986a-422a78b03bca","resolution":{"observed_at":"2026-08-10T16:19:48.337606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-10T16:19:48.024738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.024738Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:8d581bd30e6561f87614f6fcc25b861c7e7afa7e617cefa4bd547d85259d90e4","observation_id":"735f0aa3-ae13-4d38-a391-cdb011a368c0","resolution":{"observed_at":"2026-08-10T16:19:48.024738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-08-10T01:52:30.559515Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-10T16:19:48.028776Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.028776Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:b9c5a6419eb9baa8229c69bea86ff4fbc2f65a2881298130ac306b2a94d6cadc","observation_id":"e62d96b7-2b9c-4e4c-a03b-dbf15871af17","resolution":{"observed_at":"2026-08-10T16:19:48.028776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.032831Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.032831Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:6c479dfc5c14d7992d4f13ee43911303ddaac0ad16a545a13ea56e6c87e49864","observation_id":"f3ca1292-2bac-4aa4-91bc-0f9598203d2e","resolution":{"observed_at":"2026-08-10T16:19:48.032831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.317280Z","title":null,"venue":null,"work_id":"232be5b1-01f4-4a0c-815f-f7ab558ebe85","year":2021},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.036579Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:2fcd32089a5b8b9b7228df7f79d3745cc970c93bc9e34e2f623c9b52f8d259f3","observation_id":"4c83c018-6e34-4c78-8582-53e0e3149d44","resolution":{"observed_at":"2026-08-10T16:19:48.320838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12651","last_updated":"2024-07-17T07:03:57Z","snapshot_observed_at":"2026-08-10T12:18:25.194309Z","submitted_at":"2023-12-19T22:52:51Z","title":"Toxic Bias: Perspective API Misreads German as More Toxic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12651","snapshot_observed_at":"2026-08-10T16:19:48.040346Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.040346Z"},"links":{"cited_paper":"/paper/2312.12651","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:627bba39344514b8561a70b4d7bb7c3203df05a42052ad7b076d0fbb438346ec","observation_id":"cc62cd94-0d3a-422c-b00f-eebbb86aed88","resolution":{"observed_at":"2026-08-10T16:19:48.040346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.305134Z","title":"https://platform.openai.com/docs/guides/moderation","venue":null,"work_id":"cbec3b01-d0b9-4397-acac-9a1bcc87caf5","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.044231Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:4a8d43eeeceaefc99360e15efe6f0b3bcfc63e255db29c8e30eef1a20ff722a1","observation_id":"7957712b-2d95-451e-83a7-b446cda18662","resolution":{"observed_at":"2026-08-10T16:19:48.309591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.294722Z","title":null,"venue":null,"work_id":"2faa20fc-1197-44cc-b244-7f0e35466df4","year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.048144Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:6209853f9cd0539859fdc223181534bbaa2d327528ac1a4926c39e3437e7a996","observation_id":"c8a19fc6-0376-434a-b9a3-6de65f6886d0","resolution":{"observed_at":"2026-08-10T16:19:48.298317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-10T16:19:48.051712Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.051712Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:bc93e0bff42f8f70c4621d1a0e0b88f50feecd00fd31d5ba216f609c723e4b08","observation_id":"81c6a5ad-2387-4b42-af6e-661b23d00fd4","resolution":{"observed_at":"2026-08-10T16:19:48.051712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.055948Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.055948Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:7f0e97c67b6713c7f8358676a6fe63e30c5089bdc6eff6d38ab5e2d2ca63ddad","observation_id":"87807929-10c4-4f5a-acdf-3ba5921ceb0e","resolution":{"observed_at":"2026-08-10T16:19:48.055948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01326","last_updated":"2019-10-23T18:55:16Z","snapshot_observed_at":"2026-08-10T02:41:09.905723Z","submitted_at":"2019-09-03T17:50:44Z","title":"The Woman Worked as a Babysitter: On Biases in Language Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01326","snapshot_observed_at":"2026-08-10T16:19:48.059776Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.059776Z"},"links":{"cited_paper":"/paper/1909.01326","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:8653e165a9a413f95469e57443fe6a153b72feb0b8f2e342f52782738c9a84bb","observation_id":"be32b94c-a11a-42f4-91ad-6f8b2e6f96a6","resolution":{"observed_at":"2026-08-10T16:19:48.059776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.282484Z","title":null,"venue":null,"work_id":"a484556a-3224-4453-b7c5-25fa3609b74e","year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.063813Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:22f8204f44323bfe3d4381e7b8018b6ca3d06b5b1f0685db108a5080c3bd9b27","observation_id":"5501aa05-f5be-4440-b8c3-fc48a7402fea","resolution":{"observed_at":"2026-08-10T16:19:48.287544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10420","last_updated":"2023-12-23T12:53:02Z","snapshot_observed_at":"2026-08-10T21:00:36.639546Z","submitted_at":"2023-03-18T14:02:04Z","title":"A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10420","snapshot_observed_at":"2026-08-10T16:19:48.067303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.067303Z"},"links":{"cited_paper":"/paper/2303.10420","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:e7518261db1fcdbb7ebb155316bcc839793b21c095ed35defd60127f6ecc7a44","observation_id":"8308824a-6f8c-404f-a3d3-d3f10e695b8d","resolution":{"observed_at":"2026-08-10T16:19:48.067303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-08-10T11:13:59.778209Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-08-10T16:19:48.071026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.071026Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:77a95f5f091fad10fc0b2a64676a34f20d8cfd1c1a42f68a2e70a793e5808315","observation_id":"1c7a6349-470a-42d5-a062-b6dd14613b53","resolution":{"observed_at":"2026-08-10T16:19:48.071026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-10T16:19:48.074807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.074807Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:3cb967307be5010a6b0e94c0cd1ca76b865fdf0befde7e6a13994b2c8a327b87","observation_id":"232e39aa-c4af-45bb-a4fa-bde25f02c480","resolution":{"observed_at":"2026-08-10T16:19:48.074807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.078510Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.078510Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:250153a4fd0fe9952877213fb3919bad4242858bf30aae4a674586e784353c68","observation_id":"4a1c3282-f29a-4686-a57d-3e52fbfca083","resolution":{"observed_at":"2026-08-10T16:19:48.078510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.082702Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.082702Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:d1103044a9aeda00971af37fdfc607dbf2a51b33f4935d9cc70ca3528995e2b1","observation_id":"8d0b8269-2142-4f6b-92f0-ff69ef57c879","resolution":{"observed_at":"2026-08-10T16:19:48.082702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T08:54:19.957063Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2501.13302."}