{"as_of":"2026-08-19T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4d11e37e3079592f425b6f337af0b0db991e8a82c25ce30e20b19a9acd86514","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:16:32.749284Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-24T05:06:00.319233Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2308.11432","last_updated":"2025-03-02T04:04:03Z","snapshot_observed_at":"2026-08-17T02:16:24.215789Z","submitted_at":"2023-08-22T13:30:37Z","title":"A Survey on Large Language Model based Autonomous Agents","version":7},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T04:03:00.340349Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2308.11432"},"observation_digest":"sha256:3019f0ba41f2933f493a2b16ed4d7c734798e677dbab2924179aee0719aa0007","observation_id":"e1abe29f-9e10-4aed-bcf6-5bdea8dd3358","resolution":{"observed_at":"2026-05-15T04:03:00.886787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T06:25:20.966510Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2309.10253"},"observation_digest":"sha256:9e262ad418cd985fe82e0b03e2952396862d180c80a784e3e50b99531a7609c0","observation_id":"f4f50e0e-26a8-4434-aecc-24eac081f1c3","resolution":{"observed_at":"2026-05-15T06:25:21.143527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-08-17T15:25:03.596568Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T17:11:00.639293Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2310.03684"},"observation_digest":"sha256:83008977f497202d733e79037b5276d0d58293aef78e2c149424753e78006d2e","observation_id":"9916e48f-2597-40c9-9c16-f73ad2fb5ea2","resolution":{"observed_at":"2026-05-14T17:11:00.967657Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T09:48:31.721745Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2310.08419"},"observation_digest":"sha256:49bace332f987e64bcdd8e19a8cccbf9f968ea5bcce657f42fa0dc38c1edf5bf","observation_id":"21670ddf-1bd6-40da-aa4e-82f485a2cc74","resolution":{"observed_at":"2026-05-12T09:48:33.209683Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2312.03853","last_updated":"2026-04-30T10:23:33Z","snapshot_observed_at":"2026-08-12T12:42:49.265920Z","submitted_at":"2023-12-06T19:07:38Z","title":"Dr. Jekyll and Mr. Hyde: Two Faces of LLMs","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T05:05:35.726118Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2312.03853"},"observation_digest":"sha256:45b454dbdd613d57ea5f183b959026b943ea356564eaa8f2ab540d36198481fc","observation_id":"adeb3ebd-f9ce-4aa6-8893-a8ff65a1bb14","resolution":{"observed_at":"2026-05-24T05:06:00.323174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":247,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:0aa7607f9a2731bbefa6377198b859c90c977c1095c198377f21ce67902c6dab","observation_id":"e4c2cbb7-da5c-4be6-89eb-d345c32b01f1","resolution":{"observed_at":"2026-05-18T11:17:08.703042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2410.04155","last_updated":"2026-05-20T04:29:06Z","snapshot_observed_at":"2026-08-18T12:04:37.082692Z","submitted_at":"2024-10-05T13:30:33Z","title":"Toxic Subword Pruning for Dialogue Response Generation on Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-23T20:19:49.336725Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2410.04155"},"observation_digest":"sha256:5c6819a9068a9eccc4c2b52cda0aef5d1e9dc7c69120bd0f7a39184c7713bc79","observation_id":"e9ab008d-434c-4c36-979d-c911afe699ff","resolution":{"observed_at":"2026-05-23T20:23:24.806346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-11T18:27:26.170473Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07951","last_updated":"2025-05-29T16:10:25Z","snapshot_observed_at":"2026-08-17T14:57:22.784941Z","submitted_at":"2024-12-10T22:31:29Z","title":"From Lived Experience to Insight: Unpacking the Psychological Risks of Using AI Conversational Agents","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:26.170473Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2412.07951"},"observation_digest":"sha256:675c88609589e30674f287e507f6700e96aab19173575e2e81fbb1caf4c66541","observation_id":"1ba81533-fe8b-4fc0-9a89-c3f1e18091eb","resolution":{"observed_at":"2026-08-11T18:27:26.170473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-10T20:54:05.066525Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-16T06:47:56.403848Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.066525Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:66b51b1357ac1291f1dad836a650e3f54abac54783aeca03da248f88810e3137","observation_id":"c731d022-e0b5-4ab2-af41-1e260a7b6081","resolution":{"observed_at":"2026-08-10T20:54:05.066525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-10T20:52:38.193214Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06964","last_updated":"2025-01-12T22:49:32Z","snapshot_observed_at":"2026-08-19T00:40:28.526591Z","submitted_at":"2025-01-12T22:49:32Z","title":"Enhancing Patient-Centric Communication: Leveraging LLMs to Simulate Patient Perspectives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:52:38.193214Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2501.06964"},"observation_digest":"sha256:791296386aa9766ec96cad98e0f3c16950da69956db7b236719340d090ba5408","observation_id":"ba5ab789-0452-4ebf-9415-c096ec31aed5","resolution":{"observed_at":"2026-08-10T20:52:38.193214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-10T15:26:44.761325Z","title":"Deshpande, Vishvak Murahari, Tanmay Rajpurohit, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14073","last_updated":"2025-02-18T05:02:09Z","snapshot_observed_at":"2026-08-12T19:33:40.701503Z","submitted_at":"2025-01-23T20:20:20Z","title":"LLMs are Vulnerable to Malicious Prompts Disguised as Scientific Language","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T15:26:44.761325Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2501.14073"},"observation_digest":"sha256:6c552c88009a0a97800bf92a0873ae8b7445c4cdae6705ca3bd572416463bee7","observation_id":"2afd8d45-dd9e-4c55-bc1e-b3f9c6c1be48","resolution":{"observed_at":"2026-08-10T15:26:44.761325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-10T11:03:28.304717Z","title":"Toxicity in Chat- GPT: Analyzing Persona-assigned Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16750","last_updated":"2025-01-28T07:00:45Z","snapshot_observed_at":"2026-08-10T20:00:38.555772Z","submitted_at":"2025-01-28T07:00:45Z","title":"HateBench: Benchmarking Hate Speech Detectors on LLM-Generated Content and Hate Campaigns","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T11:03:28.304717Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2501.16750"},"observation_digest":"sha256:593769092bceb1ce8feebcb21f44f5d41a3fd7324a79d3134cda5417fc686fb8","observation_id":"6bc594ad-b278-462e-b48c-96687bb8aec7","resolution":{"observed_at":"2026-08-10T11:03:28.304717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-09T16:18:40.502533Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models.arXiv preprint arXiv:2304.05335, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-16T10:10:26.213081Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.502533Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:b5dd0b410033f0e7e4ebc77a74982ae9a715050197d9ff7e68eedc29b27cfa2b","observation_id":"2025b726-2696-4717-be04-c3c9820a338c","resolution":{"observed_at":"2026-08-09T16:18:40.502533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-09T18:29:43.385459Z","title":"arXiv preprint arXiv:2304.05335","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01676","last_updated":"2025-02-01T23:01:39Z","snapshot_observed_at":"2026-08-14T23:09:39.582970Z","submitted_at":"2025-02-01T23:01:39Z","title":"Benchmark on Peer Review Toxic Detection: A Challenging Task with a New Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T18:29:43.385459Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2502.01676"},"observation_digest":"sha256:2b24db0aa0f269e511d4d1086b524e69e6f0b0b6e3846a063409d36875c66d11","observation_id":"dd1dad92-56d5-4453-916b-6b9c423e243d","resolution":{"observed_at":"2026-08-09T18:29:43.385459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-15T23:16:32.749284Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05190","last_updated":"2025-05-11T14:24:22Z","snapshot_observed_at":"2026-08-18T18:19:39.001153Z","submitted_at":"2025-05-08T12:39:00Z","title":"Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:16:32.749284Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2505.05190"},"observation_digest":"sha256:2cf2b0bf520a1215f6a840f1c14cb605ced9db10f00ff0ba69cdc9ad0446c4fa","observation_id":"501d0307-42cd-4a71-8345-6560b3d86d13","resolution":{"observed_at":"2026-08-15T23:16:32.749284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-07T14:12:26.717182Z","title":"InThe Twelfth International Con- ference on Learning Representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19773","last_updated":"2025-05-26T09:57:25Z","snapshot_observed_at":"2026-08-17T14:33:10.432850Z","submitted_at":"2025-05-26T09:57:25Z","title":"What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:26.717182Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2505.19773"},"observation_digest":"sha256:b871bea8ebff44bea1a0ca3686625f4850d3ac5cdfacc648f9f39c3941442ec4","observation_id":"42064e71-fdde-4ab0-9cdc-443fcb4ca95f","resolution":{"observed_at":"2026-08-07T14:12:26.717182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-07T10:54:57.939379Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04018","last_updated":"2026-06-22T12:47:48Z","snapshot_observed_at":"2026-08-17T17:07:51.786602Z","submitted_at":"2025-06-04T14:46:47Z","title":"AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:57.939379Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2506.04018"},"observation_digest":"sha256:17004cd469303d6736fc1e3e876453d217bd543f89f59395fc5c5019bc7be9b4","observation_id":"c90ee0b7-7452-408d-8e22-c3a20c34c6f7","resolution":{"observed_at":"2026-08-07T10:54:57.939379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-07T04:34:07.870925Z","title":"arXiv preprint arXiv:2304.05335","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10217","last_updated":"2025-07-01T01:49:13Z","snapshot_observed_at":"2026-08-15T12:25:24.343032Z","submitted_at":"2025-06-11T22:26:50Z","title":"Data-Centric Safety and Ethical Measures for Data and AI Governance","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:34:07.870925Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2506.10217"},"observation_digest":"sha256:2872c5b3c2cc7a48abad3bdb9802ddf6e878a1937951d1f88645ca8866eceb6a","observation_id":"ad68433a-4a5b-4a7d-a04b-d8cb0eb51a37","resolution":{"observed_at":"2026-08-07T04:34:07.870925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-07T10:17:26.945695Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-13T12:53:10.459412Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.945695Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:27a8fabe329ba4c93901ace0a89b4d358980b05f5c344461ac34d1db3627ac6f","observation_id":"07c3f700-075d-4942-ad45-f2ab4b8434ed","resolution":{"observed_at":"2026-08-07T10:17:26.945695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-06T15:15:17.984754Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16414","last_updated":"2025-07-22T10:05:30Z","snapshot_observed_at":"2026-08-12T16:21:25.375651Z","submitted_at":"2025-07-22T10:05:30Z","title":"Identifying Pre-training Data in LLMs: A Neuron Activation-Based Detection Framework","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:15:17.984754Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2507.16414"},"observation_digest":"sha256:339aa350856d96e7d56b9f1f0c0a70d29b01e8600cc5a5500872aaa50f5e616c","observation_id":"d0a38afe-6aa1-4af0-86c3-74970dcba164","resolution":{"observed_at":"2026-08-06T15:15:17.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-06T15:13:15.547515Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16442","last_updated":"2025-07-22T10:38:02Z","snapshot_observed_at":"2026-08-18T12:48:26.607185Z","submitted_at":"2025-07-22T10:38:02Z","title":"Dutch CrowS-Pairs: Adapting a Challenge Dataset for Measuring Social Biases in Language Models for Dutch","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:13:15.547515Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2507.16442"},"observation_digest":"sha256:976e6ef77d6f29c61a7035dcb97a8d1287036d8c65286c520d72e11ec851d764","observation_id":"7c0aa087-0da7-4037-87ca-fbe1f1a602f0","resolution":{"observed_at":"2026-08-06T15:13:15.547515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-04T20:03:36.085653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08912","last_updated":"2025-09-10T18:16:46Z","snapshot_observed_at":"2026-08-07T20:13:30.269872Z","submitted_at":"2025-09-10T18:16:46Z","title":"Towards Trustworthy AI: Characterizing User-Reported Risks across LLMs \"In the Wild\"","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:03:36.085653Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2509.08912"},"observation_digest":"sha256:a5eee35fb1907a4979cf69e5b8576efb73f5f76d87f995e1a2d9d6cd51477d7e","observation_id":"f66dce05-8dae-467b-b1d9-8818193bc4dc","resolution":{"observed_at":"2026-08-04T20:03:36.085653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-04T12:27:28.661682Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03520","last_updated":"2026-06-10T17:21:57Z","snapshot_observed_at":"2026-08-15T05:15:45.677717Z","submitted_at":"2025-10-03T21:24:41Z","title":"Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T12:27:28.661682Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2510.03520"},"observation_digest":"sha256:443565cd758025ac76e18ca06aaafc0ff35ce5944caabd7df3d503cc6ad86808","observation_id":"a64c10cb-f32c-46fc-b2ef-1d39ba3bfc59","resolution":{"observed_at":"2026-08-04T12:27:28.661682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:bf54b0ce5d072a06ced16fb111c7dc88722c4f010739a79b58e32d0a9c556b74","observation_id":"62f69773-5492-4d80-bf51-95910bcb15cc","resolution":{"observed_at":"2026-05-13T04:57:17.297802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:a3f42a07fe02d9f3011bb1a75b24f1e35bc6d1ac80639380adaca9a8848664be","observation_id":"053c9985-8aee-490d-ad19-f32d181ccbe0","resolution":{"observed_at":"2026-05-15T05:45:06.563797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":"2304.05335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2304.05335 (2023)","venue":null,"work_id":"a3d03f96-9566-4a81-826b-1062ec750f9e","year":2023},"citing_paper":{"arxiv_id":"2605.14514","last_updated":"2026-05-14T07:58:47Z","snapshot_observed_at":"2026-08-10T04:23:43.463729Z","submitted_at":"2026-05-14T07:58:47Z","title":"Defenses at Odds: Measuring and Explaining Defense Conflicts in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T01:43:22.777232Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2605.14514"},"observation_digest":"sha256:0fe9a02b3d5c974005386bf1140368dddb6c095b2548d88ec9a38293809962b2","observation_id":"e2cf011e-77b4-4cc3-82da-3135301afa0e","resolution":{"observed_at":"2026-05-15T01:43:27.381147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2304.05335/citation-record","integrity":"/paper/2304.05335/integrity","json":"/paper/2304.05335/citation-record.json","paper":"/paper/2304.05335"},"outbound":[],"paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:41:14.308965Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2304.05335."}