{"as_of":"2026-08-11T12:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39ed55e9e84996c437049aa14fcfa9021ee862f559e220d28c78aa4c4ca5e7a5","coverage":[{"denominator":215,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:26.896104Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:47:38.262660Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T03:39:30.627528Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-08-06T23:49:46.938526Z","title":"Qin Liu, Fei Wang, Nan Xu, Tianyi Lorena Yan, Tao Meng, and Muhao Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16150","last_updated":"2026-06-26T06:28:20Z","snapshot_observed_at":"2026-08-08T11:35:48.926575Z","submitted_at":"2025-06-19T09:06:27Z","title":"PRISON: Unmasking the Criminal Potential of Large Language Models","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:46.938526Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2506.16150"},"observation_digest":"sha256:ab8e76056eff346dba00e55c3b5b395002ec3d44888fa7f8da6e4c73be6395ca","observation_id":"02d67783-e274-46fb-8f3c-c6728334936a","resolution":{"observed_at":"2026-08-06T23:49:46.938526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":"2506.11094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-07-04T03:39:30.627528Z","title":"CoRR, abs/2506.11094","venue":"cs.CL","work_id":"ea00501b-5c05-4e1f-b241-a07471ee5751","year":2025},"citing_paper":{"arxiv_id":"2508.05452","last_updated":"2026-04-15T14:48:07Z","snapshot_observed_at":"2026-07-06T22:09:28.204393Z","submitted_at":"2025-08-07T14:46:30Z","title":"LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models","version":7},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T00:39:02.015913Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2508.05452"},"observation_digest":"sha256:f7c2ecbb7e59c9675c824fe6555ee61425afd894fddce6509a4e7631772351ba","observation_id":"36cd4c5f-04c3-46b8-9ee2-b89c5edef328","resolution":{"observed_at":"2026-07-01T02:17:15.985374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":"2506.11094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-07-04T03:39:30.627528Z","title":"CoRR, abs/2506.11094","venue":"cs.CL","work_id":"ea00501b-5c05-4e1f-b241-a07471ee5751","year":2025},"citing_paper":{"arxiv_id":"2512.10687","last_updated":"2026-04-20T11:46:57Z","snapshot_observed_at":"2026-08-11T08:27:08.305717Z","submitted_at":"2025-12-11T14:34:40Z","title":"Safe for Whom? Rethinking How We Evaluate the Safety of LLMs for Real Users","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T23:22:42.431997Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2512.10687"},"observation_digest":"sha256:0ae54c46916cb47785998ee85e81ae56fe94ca40ce86abe9acb249c31693d785","observation_id":"be0be778-36e8-4acb-b494-9b96d9cca347","resolution":{"observed_at":"2026-07-01T02:17:15.985374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-08-03T01:25:15.252924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.03919","last_updated":"2026-07-31T10:56:23Z","snapshot_observed_at":"2026-08-06T17:08:53.739655Z","submitted_at":"2026-03-04T10:27:09Z","title":"When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T01:25:15.252924Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2603.03919"},"observation_digest":"sha256:e998cf16f9ddf44760e3332d9980e89ec736c04bc8f97849ad9762bd31057de8","observation_id":"b5b39288-6849-4912-bf6c-b08044cad947","resolution":{"observed_at":"2026-08-03T01:25:15.252924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-08-02T21:21:25.716257Z","title":"Lindsey, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13249","last_updated":"2026-05-28T14:47:48Z","snapshot_observed_at":"2026-08-09T02:53:25.541953Z","submitted_at":"2026-02-24T07:26:50Z","title":"Steering at the Source: Style Modulation Heads for Robust Persona Control","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T21:21:25.716257Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2603.13249"},"observation_digest":"sha256:2891e5794560bfd11a44d94ff7a54ad8becfa1f20db9fd9526386ce4dc787cbc","observation_id":"3ec71ee7-047f-488c-bf7a-63988fe1b47c","resolution":{"observed_at":"2026-08-02T21:21:25.716257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":"2506.11094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-07-04T03:39:30.627528Z","title":"CoRR, abs/2506.11094","venue":"cs.CL","work_id":"ea00501b-5c05-4e1f-b241-a07471ee5751","year":2025},"citing_paper":{"arxiv_id":"2606.19868","last_updated":"2026-06-18T07:27:34Z","snapshot_observed_at":"2026-08-09T02:21:37.900133Z","submitted_at":"2026-06-18T07:27:34Z","title":"A Systematic Evaluation of Black-Box Uncertainty Estimation Methods for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:46:00.822375Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2606.19868"},"observation_digest":"sha256:dfbd631e35bf977c730c5b9ac2cbfc8f3453fb194e5b55c44f613fae88a890a3","observation_id":"0a90883e-cb2f-478e-b566-4c22d751e037","resolution":{"observed_at":"2026-07-04T03:39:30.629404Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":"2506.11094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-07-04T03:39:30.627528Z","title":"CoRR, abs/2506.11094","venue":"cs.CL","work_id":"ea00501b-5c05-4e1f-b241-a07471ee5751","year":2025},"citing_paper":{"arxiv_id":"2606.20626","last_updated":"2026-05-26T17:35:31Z","snapshot_observed_at":"2026-08-06T08:20:13.528819Z","submitted_at":"2026-05-26T17:35:31Z","title":"Efficient Safety Benchmarking via Item Response Theory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T15:51:00.484343Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2606.20626"},"observation_digest":"sha256:85635f4f7a3b93078ac78ebf1459336efceb03080d6ee10a6845d0ab59a587b7","observation_id":"23fe07c8-e95d-47bc-adea-783bcbb938f0","resolution":{"observed_at":"2026-07-01T15:55:48.959767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-08-01T15:53:59.443085Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18155","last_updated":"2026-07-20T16:53:05Z","snapshot_observed_at":"2026-08-09T05:12:17.754119Z","submitted_at":"2026-07-20T16:53:05Z","title":"Testing Retrieval-Augmented Generation Systems with Chunk Coverage","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:59.443085Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2607.18155"},"observation_digest":"sha256:afdfe121c2746415dca3c5107301c2ede9f201c69e42ef757f6a3fc22b5f0518","observation_id":"0c4dbdd8-cfb3-482e-9fd6-5dcf00b4372c","resolution":{"observed_at":"2026-08-01T15:53:59.443085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11094","snapshot_observed_at":"2026-08-08T18:47:38.262660Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04375","last_updated":"2026-08-05T02:32:43Z","snapshot_observed_at":"2026-08-11T12:15:19.928446Z","submitted_at":"2026-08-05T02:32:43Z","title":"Large Language Models and Social Media Information Integrity: Opportunities, Challenges, and Research Directions","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-08T18:47:38.262660Z"},"links":{"cited_paper":"/paper/2506.11094","citing_paper":"/paper/2608.04375"},"observation_digest":"sha256:6f7f54f872eda828ec4dd48e36f5bfb6efd4145e21c52d0efe81a7a4964e04c5","observation_id":"d46ec9ac-96fe-416b-9832-b160189c2997","resolution":{"observed_at":"2026-08-08T18:47:38.262660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11094/citation-record","integrity":"/paper/2506.11094/integrity","json":"/paper/2506.11094/citation-record.json","paper":"/paper/2506.11094"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.578627Z","title":"A survey on evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.578627Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:f92765dfaaac303cfabf56882852a9525ee9d2988d3d617165ed6d517fcaabdf","observation_id":"0d671c9f-27dc-4248-92ca-ef486691a2b3","resolution":{"observed_at":"2026-08-07T10:17:26.578627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.583802Z","title":"A systematic review on human and computer interaction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.583802Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:a760972f143922cc6643b25f45e762f8a38655b17680f8f28fb5e507d39637e0","observation_id":"79aab667-973b-4619-8aae-7c2fb795b132","resolution":{"observed_at":"2026-08-07T10:17:26.583802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14118","last_updated":"2024-10-28T07:45:22Z","snapshot_observed_at":"2026-07-06T17:48:03.807374Z","submitted_at":"2024-03-21T04:07:40Z","title":"From Handcrafted Features to LLMs: A Brief Survey for Machine Translation Quality Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14118","snapshot_observed_at":"2026-08-07T10:17:26.587464Z","title":"From handcrafted features to llms: A brief survey for machine translation quality estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.587464Z"},"links":{"cited_paper":"/paper/2403.14118","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:36c3e49fb744a9f06088dae38d58bdf451f560e3404ef056118cf7c58fb987a3","observation_id":"7dee63a2-a51e-4896-84cb-287a56989c97","resolution":{"observed_at":"2026-08-07T10:17:26.587464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-09T17:22:51.227375Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-07T10:17:26.591222Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.591222Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3185b7ae11ae88acfdca7181dacecd17814d71d0aa646cfa9d12e28bea82ebb1","observation_id":"794a941e-1db0-4fa3-8c6f-cdc41b73ba3e","resolution":{"observed_at":"2026-08-07T10:17:26.591222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14321","last_updated":"2026-05-26T03:02:22Z","snapshot_observed_at":"2026-08-07T18:02:46.226109Z","submitted_at":"2025-02-20T07:18:34Z","title":"Beyond Self-Talk: A Communication-Centric Survey of LLM-Based Multi-Agent Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14321","snapshot_observed_at":"2026-08-07T10:17:26.594818Z","title":"Beyond self-talk: A communication-centric survey of llm-based multi- agent systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.594818Z"},"links":{"cited_paper":"/paper/2502.14321","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:23db55b6927c8df4626c724d717174318a4fa5a5aba9da26507b8165cb1ab8f5","observation_id":"8f2b867d-b91f-44e1-bce2-84835ad69aa5","resolution":{"observed_at":"2026-08-07T10:17:26.594818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09253","last_updated":"2024-09-14T01:45:04Z","snapshot_observed_at":"2026-08-09T22:33:20.873483Z","submitted_at":"2024-09-14T01:45:04Z","title":"Unleash LLMs Potential for Recommendation by Coordinating Twin-Tower Dynamic Semantic Token Generator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09253","snapshot_observed_at":"2026-08-07T10:17:26.598372Z","title":"Unleash llms potential for recommendation by coordinating twin-tower dynamic semantic token generator,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.598372Z"},"links":{"cited_paper":"/paper/2409.09253","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:c86052bc3ec1f65c0260ed77ab6af526b21d52eeac8410b1c6cd882f568d3edd","observation_id":"e2cf32aa-d78e-41dc-a8cc-284c5133b36b","resolution":{"observed_at":"2026-08-07T10:17:26.598372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-10T11:01:45.709568Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-07T10:17:26.602021Z","title":"Beyond accuracy: Evaluating the rea- soning behavior of large language models–a survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.602021Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:a506348bd2b46d7562c7732696b62db47699d8b1e1c3ebe30a80fc898bc030c6","observation_id":"3608d722-55aa-45b5-8579-e4e6c896ec9e","resolution":{"observed_at":"2026-08-07T10:17:26.602021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T10:17:26.605878Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.605878Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:d8b0763e7b288b5aebf22788de6ccba4376e68685cc34f64309a3428dd36a07f","observation_id":"3c8b545b-a87d-4e72-8e17-c060b15cf272","resolution":{"observed_at":"2026-08-07T10:17:26.605878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.609382Z","title":"Is chatgpt fair for recommendation? evaluating fairness in large language model recommendation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.609382Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:51612d8f5f0d25fd0e68b02e2d191161ca9de848d8c1892b882ead7ab35f5fb0","observation_id":"07958821-5743-4529-b082-170c73e16931","resolution":{"observed_at":"2026-08-07T10:17:26.609382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01336","last_updated":"2024-10-15T12:40:39Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-30T14:39:09Z","title":"FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01336","snapshot_observed_at":"2026-08-07T10:17:26.612552Z","title":"Finefake: A knowledge-enriched dataset for fine-grained multi-domain fake news detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.612552Z"},"links":{"cited_paper":"/paper/2404.01336","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:e2217c0d94bd8e0fbbbf535ea765071b7575e819559503d81af4325befcf0a67","observation_id":"9fc1dd70-6916-4333-b1ca-16117d61bcc0","resolution":{"observed_at":"2026-08-07T10:17:26.612552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.615851Z","title":"Baitattack: Alleviating intention shift in jailbreak attacks via adaptive bait craft- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.615851Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:d3c748ed1685c3484376872488a25df8d7b430b82bc77d0fd5af89bb644433b1","observation_id":"4a85706f-d7d3-4a80-9b79-02a63d2b3316","resolution":{"observed_at":"2026-08-07T10:17:26.615851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16327","last_updated":"2025-07-08T03:32:27Z","snapshot_observed_at":"2026-07-06T19:37:20.613838Z","submitted_at":"2024-10-18T17:02:13Z","title":"Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16327","snapshot_observed_at":"2026-08-07T10:17:26.618779Z","title":"Feint and attack: Attention-based strategies for jailbreaking and protecting llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.618779Z"},"links":{"cited_paper":"/paper/2410.16327","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:5d3c5b65f33b7f05014dd062c38f370b347bda8cf65ad075f3a37c26a11010bd","observation_id":"62e4b8f5-7ef9-451f-8f30-fb596ba32f98","resolution":{"observed_at":"2026-08-07T10:17:26.618779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00240","last_updated":"2024-06-01T00:11:09Z","snapshot_observed_at":"2026-07-06T18:23:39.931536Z","submitted_at":"2024-06-01T00:11:09Z","title":"Exploring Vulnerabilities and Protections in Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00240","snapshot_observed_at":"2026-08-07T10:17:26.621846Z","title":"Exploring vulnerabilities and protections in large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.621846Z"},"links":{"cited_paper":"/paper/2406.00240","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3278b00b8b46ce9713997e1c5757baa83c0dd8b71e10e9a0af5a46d8c7353fef","observation_id":"2b0c7702-ed59-4dc6-85aa-41f05fed7972","resolution":{"observed_at":"2026-08-07T10:17:26.621846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T10:17:26.624960Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.624960Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:374c088f9624fdc44f85b8bd7e7c97b8e91a230181bacd2d01a1d1a4ef706a38","observation_id":"d8a0c089-0661-4617-a4b5-db7137f29cea","resolution":{"observed_at":"2026-08-07T10:17:26.624960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-09T16:06:53.947436Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-07T10:17:26.628023Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.628023Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:5a73ef1c203818e7dda038e27d1f210b09428125ee4a390b44ee0ad8bbf7dbeb","observation_id":"3c486612-93d0-40dc-85e4-27353eafd775","resolution":{"observed_at":"2026-08-07T10:17:26.628023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-07T10:17:26.631200Z","title":"Jailbreak attacks and defenses against large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.631200Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:b2fc83dd838e3be4b6c7aeaa641dc8e98dd6e7be17ef72e38b5113f1de3c852f","observation_id":"77dac2f4-a68d-49be-8a83-9918c71cd095","resolution":{"observed_at":"2026-08-07T10:17:26.631200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09321","last_updated":"2025-02-04T16:04:22Z","snapshot_observed_at":"2026-08-10T23:28:12.745734Z","submitted_at":"2024-06-13T16:59:43Z","title":"JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09321","snapshot_observed_at":"2026-08-07T10:17:26.634313Z","title":"Jailbreakeval: An integrated toolkit for evaluating jailbreak attempts against large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.634313Z"},"links":{"cited_paper":"/paper/2406.09321","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:8224fe14179c3195c807b5580865302a2e98ec706011cb4345d2374db6c79a4a","observation_id":"ff504655-46db-46a2-b087-d917977f14b4","resolution":{"observed_at":"2026-08-07T10:17:26.634313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.637966Z","title":"Safetyprompts: a systematic review of open datasets for evaluating and improving large language model safety,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.637966Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3ddc2b71723331c12c53132a186da4a524f580173f74ed989e75b315ca8475fa","observation_id":"2edbefe7-2513-4717-8e2f-d050fbb498da","resolution":{"observed_at":"2026-08-07T10:17:26.637966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00936","last_updated":"2024-06-03T02:20:03Z","snapshot_observed_at":"2026-08-10T11:55:24.713336Z","submitted_at":"2024-06-03T02:20:03Z","title":"A Survey of Useful LLM Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00936","snapshot_observed_at":"2026-08-07T10:17:26.641060Z","title":"A survey of useful llm evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.641060Z"},"links":{"cited_paper":"/paper/2406.00936","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:0ef1c6acc5abd63bdceb02a264eee59b62b18a6c2c3c5595b91b57436373bea8","observation_id":"cabd2fa2-ce3a-46d0-b8eb-b7940e966dde","resolution":{"observed_at":"2026-08-07T10:17:26.641060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-07-06T12:49:18.486644Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-07T10:17:26.644437Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.644437Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:4089153c90e0663158b4414515bcc8138fe584c4fc667202d214c85ee36fa6ad","observation_id":"efb100cd-e091-4f8a-8418-59cf60dcab4f","resolution":{"observed_at":"2026-08-07T10:17:26.644437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17389","last_updated":"2023-10-26T13:35:41Z","snapshot_observed_at":"2026-07-06T16:38:56.540232Z","submitted_at":"2023-10-26T13:35:41Z","title":"ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17389","snapshot_observed_at":"2026-08-07T10:17:26.647489Z","title":"Toxicchat: Unveiling hidden challenges of toxicity detection in real- world user-ai conversation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.647489Z"},"links":{"cited_paper":"/paper/2310.17389","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3b00593451c8669d2cbe2413b31f96c2f8515d2b9813791e43795e6cd3897c8f","observation_id":"899debdd-8dbc-4652-b50f-8fe1d3245bd9","resolution":{"observed_at":"2026-08-07T10:17:26.647489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09585","last_updated":"2024-03-19T02:20:50Z","snapshot_observed_at":"2026-08-03T08:55:09.707467Z","submitted_at":"2023-11-16T05:43:02Z","title":"LifeTox: Unveiling Implicit Toxicity in Life Advice","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09585","snapshot_observed_at":"2026-08-07T10:17:26.651171Z","title":"Lifetox: Unveil- ing implicit toxicity in life advice,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.651171Z"},"links":{"cited_paper":"/paper/2311.09585","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:b33e483211e5d93f06a7f5650aa0bc5526fe58a9dbe95e843064df5d4aaaf973","observation_id":"df9502d1-5d95-4f67-84f4-d16102d59678","resolution":{"observed_at":"2026-08-07T10:17:26.651171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09373","last_updated":"2024-08-10T02:27:57Z","snapshot_observed_at":"2026-07-06T18:14:46.143061Z","submitted_at":"2024-05-15T14:22:33Z","title":"PolygloToxicityPrompts: Multilingual Evaluation of Neural Toxic Degeneration in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09373","snapshot_observed_at":"2026-08-07T10:17:26.654550Z","title":"Polyglotoxicityprompts: Multilingual evaluation of neural toxic degen- eration in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.654550Z"},"links":{"cited_paper":"/paper/2405.09373","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:6ac646e2df5d2ed3c3a34f70dc6fb3a36d8cd10ae23481ea351dd152ca7a3b19","observation_id":"86eca9ba-8ef8-4712-bdef-27c0e1b819a1","resolution":{"observed_at":"2026-08-07T10:17:26.654550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-11T11:06:30.148202Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T10:17:26.657917Z","title":"Red-teaming large language mod- els using chain of utterances for safety-alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.657917Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:0d0a092de8e028c15a5f7c2dab3733b6381c58efaf6a10629b871a1a504a3fbc","observation_id":"73959c27-4331-4ad2-ac15-f280e44a1f53","resolution":{"observed_at":"2026-08-07T10:17:26.657917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18580","last_updated":"2024-12-23T05:04:49Z","snapshot_observed_at":"2026-08-09T23:18:23.231319Z","submitted_at":"2023-11-30T14:18:47Z","title":"FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18580","snapshot_observed_at":"2026-08-07T10:17:26.661091Z","title":"Fft: Towards harmlessness evaluation and analysis for llms with factuality, fairness, toxicity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.661091Z"},"links":{"cited_paper":"/paper/2311.18580","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:5a5a26acccb74ed611c63ecc3dedb5e8ba974fbf0f1aa7218b7940315c5c511a","observation_id":"f50081d6-ece3-4f50-84f9-57b8b880f014","resolution":{"observed_at":"2026-08-07T10:17:26.661091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12867","last_updated":"2023-05-29T17:46:54Z","snapshot_observed_at":"2026-08-10T02:40:14.785930Z","submitted_at":"2023-01-30T13:20:48Z","title":"Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12867","snapshot_observed_at":"2026-08-07T10:17:26.664466Z","title":"Red teaming chatgpt via jailbreaking: Bias, robustness, reliability and toxicity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.664466Z"},"links":{"cited_paper":"/paper/2301.12867","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:f9d8630ef3060aaaa337c24865d4062fbe234d9ff1da9abbf932801b09a850c0","observation_id":"0585a788-d1a7-4811-99c0-f81da675aa71","resolution":{"observed_at":"2026-08-07T10:17:26.664466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09326","last_updated":"2024-08-18T01:58:03Z","snapshot_observed_at":"2026-08-10T05:36:40.657661Z","submitted_at":"2024-08-18T01:58:03Z","title":"Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09326","snapshot_observed_at":"2026-08-07T10:17:26.667702Z","title":"Characterizing and evaluating the reliability of llms against jailbreak attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.667702Z"},"links":{"cited_paper":"/paper/2408.09326","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:209604be1c382c13ee5143d44e5f8d0ed75e78876924aa03ca5d11946d97374b","observation_id":"2df7b617-89ad-4115-b950-f532132b1e0c","resolution":{"observed_at":"2026-08-07T10:17:26.667702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.671111Z","title":"Decodingtrust: A comprehen- sive assessment of trustworthiness in gpt models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.671111Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:11fb738b2daca68f561180ff4a8b3be64a0a64aafe5325ca7165cf5e6229d2b7","observation_id":"7437ff4a-917b-4a66-8634-2c166b2d0948","resolution":{"observed_at":"2026-08-07T10:17:26.671111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09624","last_updated":"2023-11-11T05:30:34Z","snapshot_observed_at":"2026-07-06T16:33:04.032904Z","submitted_at":"2023-10-14T17:10:28Z","title":"ASSERT: Automated Safety Scenario Red Teaming for Evaluating the Robustness of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09624","snapshot_observed_at":"2026-08-07T10:17:26.674036Z","title":"Assert: Automated safety scenario red teaming for evaluating the robustness of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.674036Z"},"links":{"cited_paper":"/paper/2310.09624","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:7a72519b56058093378a956898e527a9acb14c4b07241749b304c4057144a2f6","observation_id":"fd341ccf-1802-4f7c-8bd4-19f107d7fd08","resolution":{"observed_at":"2026-08-07T10:17:26.674036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.677245Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.677245Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:2c1d94f7d86c06c2c8b1d59e5069bb34fb889fee43c6aeb89a4e1b1da6a81ec7","observation_id":"246dee32-faa0-4b6a-9816-3e488e486aa4","resolution":{"observed_at":"2026-08-07T10:17:26.677245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-07T10:17:26.680061Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.680061Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:b6b33730a2d2b1db56e43cb887b81194d887643e27fdc3569187d850a698daac","observation_id":"bad267d3-7a60-4952-bd1b-c2613b7637b3","resolution":{"observed_at":"2026-08-07T10:17:26.680061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-07T10:17:26.683728Z","title":"Xstest: A test suite for identifying exaggerated safety be- haviours in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.683728Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:4f7145dfbbcbc7fa626ca6fbd6415eade418851e48c633c9c9d8f82cd8913d17","observation_id":"a65bfd8b-b3c0-4bce-9709-2d22f65ccfec","resolution":{"observed_at":"2026-08-07T10:17:26.683728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-07-06T19:08:48.648862Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-07T10:17:26.686789Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.686789Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:a2b58799f4148b6be9399e3cd898fb47d9a70f26735ee2474dcab4dee39cf719","observation_id":"4bf1d9f4-6e4d-43e9-ae6a-df2c055a56fc","resolution":{"observed_at":"2026-08-07T10:17:26.686789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00287","last_updated":"2023-12-30T17:37:06Z","snapshot_observed_at":"2026-07-06T17:10:12.654580Z","submitted_at":"2023-12-30T17:37:06Z","title":"The Art of Defending: A Systematic Evaluation and Analysis of LLM Defense Strategies on Safety and Over-Defensiveness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00287","snapshot_observed_at":"2026-08-07T10:17:26.690689Z","title":"The art of defending: A systematic evaluation and analysis of llm defense strategies on safety and over-defensiveness,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.690689Z"},"links":{"cited_paper":"/paper/2401.00287","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:33ed3141b76ee26897848062abed3c0fbd629d670e6b6897d752a14814eb0aee","observation_id":"a35ca690-ee7d-4ed1-9390-0c435e34c5e2","resolution":{"observed_at":"2026-08-07T10:17:26.690689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15302","last_updated":"2024-11-16T19:21:32Z","snapshot_observed_at":"2026-08-09T22:16:31.581504Z","submitted_at":"2024-02-23T13:03:12Z","title":"How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15302","snapshot_observed_at":"2026-08-07T10:17:26.693976Z","title":"How (un) ethical are instruction-centric responses of llms? unveiling the vul- nerabilities of safety guardrails to harmful queries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.693976Z"},"links":{"cited_paper":"/paper/2402.15302","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:0bcfbc565f58a428005533e4ad88286779f89baec8dbd604d34181f620ebb47d","observation_id":"bd275b6f-cf16-4016-84a6-b0e451a0f417","resolution":{"observed_at":"2026-08-07T10:17:26.693976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01460","last_updated":"2024-07-27T05:55:42Z","snapshot_observed_at":"2026-08-09T09:20:47.618916Z","submitted_at":"2024-07-27T05:55:42Z","title":"LocalValueBench: A Collaboratively Built and Extensible Benchmark for Evaluating Localized Value Alignment and Ethical Safety in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01460","snapshot_observed_at":"2026-08-07T10:17:26.697138Z","title":"Localvaluebench: A collaboratively built and extensible benchmark for evaluating localized value alignment and ethical safety in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.697138Z"},"links":{"cited_paper":"/paper/2408.01460","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:1459ce55b4e31232627c08d4ab30b9a3507529bbf97ec7b2ec690a7edf55d7f8","observation_id":"12cc8f6e-20cc-46c9-b7c2-170b918e2bf8","resolution":{"observed_at":"2026-08-07T10:17:26.697138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04428","last_updated":"2025-07-04T03:19:53Z","snapshot_observed_at":"2026-08-10T00:31:45.865113Z","submitted_at":"2024-06-06T18:15:01Z","title":"MoralBench: Moral Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04428","snapshot_observed_at":"2026-08-07T10:17:26.700389Z","title":"Moralbench: Moral evaluation of llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.700389Z"},"links":{"cited_paper":"/paper/2406.04428","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:722529de76276554879742f508ef19a7efbbbd9cd5dfbb69c1d2a0815501a410","observation_id":"c0e0969a-7990-4d95-86d8-0c75ce9bdd7a","resolution":{"observed_at":"2026-08-07T10:17:26.700389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09705","last_updated":"2023-07-19T01:22:40Z","snapshot_observed_at":"2026-07-06T15:55:41.294452Z","submitted_at":"2023-07-19T01:22:40Z","title":"CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09705","snapshot_observed_at":"2026-08-07T10:17:26.703758Z","title":"Cvalues: Measuring the values of chinese large language models from safety to responsibility,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.703758Z"},"links":{"cited_paper":"/paper/2307.09705","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:0b4d9b4f3f333980a32b6715552bf2159cfda197a8e91802d3faa7a1717be984","observation_id":"5e5cd74e-3be7-4dbe-abba-1a8aedd5252c","resolution":{"observed_at":"2026-08-07T10:17:26.703758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10436","last_updated":"2023-04-20T16:27:35Z","snapshot_observed_at":"2026-07-06T15:17:59.640907Z","submitted_at":"2023-04-20T16:27:35Z","title":"Safety Assessment of Chinese Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10436","snapshot_observed_at":"2026-08-07T10:17:26.706992Z","title":"Safety assessment of chinese large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.706992Z"},"links":{"cited_paper":"/paper/2304.10436","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:6199dfebc81997b2916f1708d9f19d2b3c63607ce39d60e8e3e878bc9b58489e","observation_id":"86fa3827-6a84-4057-addf-83750dbedcec","resolution":{"observed_at":"2026-08-07T10:17:26.706992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02275","last_updated":"2023-02-17T16:08:22Z","snapshot_observed_at":"2026-08-06T11:22:24.347810Z","submitted_at":"2020-08-05T17:59:16Z","title":"Aligning AI With Shared Human Values","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02275","snapshot_observed_at":"2026-08-07T10:17:26.710261Z","title":"Aligning ai with shared human values,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.710261Z"},"links":{"cited_paper":"/paper/2008.02275","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:8280f8ac912cfe4cef3845463bc171e22706bf842717630e5f381e9083f71528","observation_id":"18bd0858-bb54-4480-96c5-5a4b79ac9dd9","resolution":{"observed_at":"2026-08-07T10:17:26.710261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08441","last_updated":"2025-02-13T11:30:41Z","snapshot_observed_at":"2026-08-04T08:23:03.074937Z","submitted_at":"2024-07-11T12:30:19Z","title":"Are Large Language Models Really Bias-Free? Jailbreak Prompts for Assessing Adversarial Robustness to Bias Elicitation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08441","snapshot_observed_at":"2026-08-07T10:17:26.713424Z","title":"Are large language models really bias-free? jailbreak prompts for assessing adversarial robustness to bias elicitation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.713424Z"},"links":{"cited_paper":"/paper/2407.08441","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:e11dbf05ae9b621e565aa035d57c45e906cdf9ccbe6f8259cb19bedd8eb09aae","observation_id":"198b5e76-ea6c-46ad-95b0-36c8805787b9","resolution":{"observed_at":"2026-08-07T10:17:26.713424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03192","last_updated":"2024-06-25T20:54:16Z","snapshot_observed_at":"2026-08-10T13:24:59.866973Z","submitted_at":"2024-04-04T04:23:19Z","title":"Do Large Language Models Rank Fairly? An Empirical Study on the Fairness of LLMs as Rankers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03192","snapshot_observed_at":"2026-08-07T10:17:26.716770Z","title":"Do large language models rank fairly? an empirical study on the fairness of llms as rankers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.716770Z"},"links":{"cited_paper":"/paper/2404.03192","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:c5f6c64772c5bb180acb26be68b903081ea0615f1e8414cf5fa07967c5e2f507","observation_id":"0ec36478-e17c-4e3b-9364-1a256ec128a5","resolution":{"observed_at":"2026-08-07T10:17:26.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02408","last_updated":"2025-02-22T02:44:54Z","snapshot_observed_at":"2026-08-10T17:45:01.146019Z","submitted_at":"2024-07-02T16:31:37Z","title":"CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02408","snapshot_observed_at":"2026-08-07T10:17:26.720062Z","title":"Ceb: Compositional evaluation benchmark for fairness in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.720062Z"},"links":{"cited_paper":"/paper/2407.02408","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:536de2391954d61d9a7f9721f60ed1d4ea4cff1f486011400dffe19b65ea24b6","observation_id":"55a85855-b2ce-4594-8d40-04ba76c817d6","resolution":{"observed_at":"2026-08-07T10:17:26.720062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16244","last_updated":"2023-06-28T14:14:44Z","snapshot_observed_at":"2026-08-10T14:51:18.945183Z","submitted_at":"2023-06-28T14:14:44Z","title":"CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16244","snapshot_observed_at":"2026-08-07T10:17:26.723290Z","title":"Cbbq: A chinese bias benchmark dataset curated with human-ai collaboration for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.723290Z"},"links":{"cited_paper":"/paper/2306.16244","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:eac08c60a71e20001a661bac676fa8b649bcab6d1a57b81a6bde0d9374397d29","observation_id":"719252a1-2bff-4c05-aa12-071d48ef29e7","resolution":{"observed_at":"2026-08-07T10:17:26.723290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.726445Z","title":"Llm-driven robots risk enacting discrimination, violence, and unlawful actions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.726445Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:a0a20a3c2ec53b580fefe2ad2b22bde537e2a7af9184e5f01fa208f30db61876","observation_id":"4ae11f88-b433-446d-80f2-53ab15d3184e","resolution":{"observed_at":"2026-08-07T10:17:26.726445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-07T10:17:26.729392Z","title":"Large language models are not fair evaluators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.729392Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:948c2a7b9c2c1de3ae90c1c39e36134688087b6fe8b022ef10eef716e91b168b","observation_id":"0c083f40-2499-4e1c-a67d-2e875657e0cc","resolution":{"observed_at":"2026-08-07T10:17:26.729392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.732664Z","title":"How are llms mitigating stereotyping harms? learning from search engine studies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.732664Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:73a6fc49c7b6fd4f0fe68cae444324fac7e8cb69dd0cc75a0b782f680ea79498","observation_id":"665b996d-3227-477d-8604-74fa96cfbbc2","resolution":{"observed_at":"2026-08-07T10:17:26.732664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09013","last_updated":"2025-04-28T04:20:13Z","snapshot_observed_at":"2026-08-04T07:22:09.543265Z","submitted_at":"2024-09-13T17:41:12Z","title":"AI-LieDar: Examine the Trade-off Between Utility and Truthfulness in LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09013","snapshot_observed_at":"2026-08-07T10:17:26.735758Z","title":"Ai-liedar: Examine the trade-off between utility and truthfulness in llm agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.735758Z"},"links":{"cited_paper":"/paper/2409.09013","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:c99892b50b98105a6a789254fa4d9e734e0c45a40dbdf824aee537448c87b93e","observation_id":"39cbd2d9-dab3-492f-a284-47963571fed9","resolution":{"observed_at":"2026-08-07T10:17:26.735758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11353","last_updated":"2024-11-30T02:27:09Z","snapshot_observed_at":"2026-08-08T02:19:01.020067Z","submitted_at":"2024-09-17T16:55:25Z","title":"THaMES: An End-to-End Tool for Hallucination Mitigation and Evaluation in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11353","snapshot_observed_at":"2026-08-07T10:17:26.738790Z","title":"Thames: An end-to-end tool for hallucination mitigation and evaluation in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.738790Z"},"links":{"cited_paper":"/paper/2409.11353","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:dad64513f870e947888c3d79a1939355bbfe316b409bbdaf96e78e85130220c1","observation_id":"7cde5061-c429-4817-b56b-05cde472faeb","resolution":{"observed_at":"2026-08-07T10:17:26.738790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.742248Z","title":"Reeval: Automatic hallucination evaluation for retrieval-augmented large language models via transferable adversarial attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.742248Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:79f8d9c8e046928ffef5ac385a455926251d73639ab838091c6309670a118cec","observation_id":"a9d9be6e-fa23-4842-b1b6-02c01382487d","resolution":{"observed_at":"2026-08-07T10:17:26.742248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11747","last_updated":"2023-10-23T01:49:32Z","snapshot_observed_at":"2026-08-10T13:04:51.592649Z","submitted_at":"2023-05-19T15:36:27Z","title":"HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11747","snapshot_observed_at":"2026-08-07T10:17:26.745240Z","title":"Halueval: A large-scale hallucination evaluation benchmark for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.745240Z"},"links":{"cited_paper":"/paper/2305.11747","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:32ae2d7e149247607a37eae7622d86d0811340ea418b09d48021870ee459452c","observation_id":"ac6ba528-14f1-40f3-8587-189ec7a0cb6d","resolution":{"observed_at":"2026-08-07T10:17:26.745240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.748537Z","title":"Openfactcheck: A unified framework for factuality evaluation of llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.748537Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:d93283eec61aa562476b91d4d4162f0602df4f5d986ec8479b15175f8e215299","observation_id":"a939db54-6ef6-4da4-abbb-1433c861881d","resolution":{"observed_at":"2026-08-07T10:17:26.748537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10793","last_updated":"2024-07-15T15:11:16Z","snapshot_observed_at":"2026-08-10T04:06:00.567393Z","submitted_at":"2024-07-15T15:11:16Z","title":"GraphEval: A Knowledge-Graph Based LLM Hallucination Evaluation Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10793","snapshot_observed_at":"2026-08-07T10:17:26.751297Z","title":"Grapheval: A knowledge-graph based llm hallucination evaluation framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.751297Z"},"links":{"cited_paper":"/paper/2407.10793","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:e6856a51e095e527fd16d656439e8be24c15fe40eb88acb90ba6ea7204b94e1b","observation_id":"b3f68e55-99b5-41d3-abc2-d4854aa90b2b","resolution":{"observed_at":"2026-08-07T10:17:26.751297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05868","last_updated":"2024-12-22T07:28:15Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:31:03Z","title":"KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05868","snapshot_observed_at":"2026-08-07T10:17:26.754339Z","title":"Kg-fpq: Evaluating factu- ality hallucination in llms with knowledge graph-based false premise questions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.754339Z"},"links":{"cited_paper":"/paper/2407.05868","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:16f29dff5c27f919db610e09dcf5bec499add0ccee7a0443bb62ef737651eb5b","observation_id":"fabd4c46-bc56-4d00-8869-3f6d6c3d1eaf","resolution":{"observed_at":"2026-08-07T10:17:26.754339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12787","last_updated":"2024-09-06T04:30:50Z","snapshot_observed_at":"2026-08-11T11:58:20.348426Z","submitted_at":"2024-08-23T01:37:29Z","title":"LLM-PBE: Assessing Data Privacy in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12787","snapshot_observed_at":"2026-08-07T10:17:26.757454Z","title":"Llm-pbe: Assessing data privacy in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.757454Z"},"links":{"cited_paper":"/paper/2408.12787","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:ba7f3d1685caf4973582f6cd911279a6058ee291601234ea4c106d905beb55ab","observation_id":"e02cde99-356d-4ff2-be5e-a779481382e2","resolution":{"observed_at":"2026-08-07T10:17:26.757454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03744","last_updated":"2024-10-09T17:22:24Z","snapshot_observed_at":"2026-08-10T11:01:44.914875Z","submitted_at":"2024-03-06T14:34:07Z","title":"MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03744","snapshot_observed_at":"2026-08-07T10:17:26.760644Z","title":"Medsafetybench: Evaluating and improving the medical safety of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.760644Z"},"links":{"cited_paper":"/paper/2403.03744","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:fc77d85d98355f5629e1805a791713b10196841ad64df170517c35bd26bacd18","observation_id":"01061d32-ffd0-4517-a929-7490bfdff1c3","resolution":{"observed_at":"2026-08-07T10:17:26.760644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-10T13:10:29.115486Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-07T10:17:26.763796Z","title":"Purple llama cyberseceval: A secure coding benchmark for language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.763796Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:bd2d60810ccf317f2e07878a04b815df34fa2a3cad29532abb5b9574bf09f69d","observation_id":"78188daa-cfd8-411e-b556-0bf09ef0c4f5","resolution":{"observed_at":"2026-08-07T10:17:26.763796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.766976Z","title":"Cweval: Outcome- driven evaluation on functionality and security of llm code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.766976Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:f4440929495de810755fcbfd7ab039e655e246f16e6f6d40b81a50be55ff8863","observation_id":"a5c71bf5-c1c4-4f94-841b-1543d665cf28","resolution":{"observed_at":"2026-08-07T10:17:26.766976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-08-07T10:17:26.769794Z","title":"Safegenbench: A benchmark framework for security vulnerability detection in llm-generated code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.769794Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:2bb8a0b16aabfca0b4a7f7c6eff3340287d113567723b6e583cba66a9cb650a3","observation_id":"61f9837f-bff1-4280-b78e-f6453c9785b0","resolution":{"observed_at":"2026-08-07T10:17:26.769794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12975","last_updated":"2024-08-21T11:57:05Z","snapshot_observed_at":"2026-08-08T09:49:58.094378Z","submitted_at":"2024-06-18T18:00:03Z","title":"SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12975","snapshot_observed_at":"2026-08-07T10:17:26.773303Z","title":"Shield: Evaluation and defense strategies for copyright compliance in llm text generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.773303Z"},"links":{"cited_paper":"/paper/2406.12975","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:63fcc7205dd231aa03811e4b4235e4e74b8d9b2de7bd88039f974150327c2b6f","observation_id":"af3df8c1-40a0-46ea-be95-24be8b49e5bd","resolution":{"observed_at":"2026-08-07T10:17:26.773303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21134","last_updated":"2026-07-27T09:44:33Z","snapshot_observed_at":"2026-08-08T04:33:33.957015Z","submitted_at":"2025-07-22T17:52:29Z","title":"TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21134","snapshot_observed_at":"2026-08-07T10:17:26.776487Z","title":"Trident: Bench- marking llm safety in finance, medicine, and law,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.776487Z"},"links":{"cited_paper":"/paper/2507.21134","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3c896aed6d0d29df788719dd2fbee50b47fc7c7a8876a2f0c4e3d9133d6b77e9","observation_id":"0dda50f5-b5d6-496b-9d01-6bbc18b3d89b","resolution":{"observed_at":"2026-08-07T10:17:26.776487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06407","last_updated":"2024-05-07T14:06:23Z","snapshot_observed_at":"2026-08-08T01:17:47.680540Z","submitted_at":"2024-04-09T15:54:16Z","title":"Rethinking How to Evaluate Language Model Jailbreak","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06407","snapshot_observed_at":"2026-08-07T10:17:26.779684Z","title":"Take a look at it! rethinking how to evaluate language model jailbreak,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.779684Z"},"links":{"cited_paper":"/paper/2404.06407","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:04f50567c7cd69e0d8d232fc74d58c3569f72c1ec9e434de7d92af388d4876e8","observation_id":"523e7bf9-488c-4f03-955d-551ed5e6783d","resolution":{"observed_at":"2026-08-07T10:17:26.779684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-08-07T10:17:26.782747Z","title":"A strongreject for empty jailbreaks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.782747Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:70d2dade7470852aac684c3518d338e0af1861e18d796fa7375a0205ba366605","observation_id":"02c0fdab-1e14-4b37-9335-3bfda1829338","resolution":{"observed_at":"2026-08-07T10:17:26.782747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11668","last_updated":"2025-02-03T09:25:08Z","snapshot_observed_at":"2026-07-06T18:32:19.794373Z","submitted_at":"2024-06-17T15:51:01Z","title":"\"Not Aligned\" is Not \"Malicious\": Being Careful about Hallucinations of Large Language Models' Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11668","snapshot_observed_at":"2026-08-07T10:17:26.785868Z","title":"\" not aligned","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.785868Z"},"links":{"cited_paper":"/paper/2406.11668","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:c58a59587e59c42b005e11ad14e654c5fdbcc72464cd2d5599681f47116537d9","observation_id":"6a1bdefb-1b64-4581-99ed-cd19080fb6c1","resolution":{"observed_at":"2026-08-07T10:17:26.785868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05668","last_updated":"2025-05-26T12:56:04Z","snapshot_observed_at":"2026-08-10T23:28:02.754591Z","submitted_at":"2024-02-08T13:42:50Z","title":"JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05668","snapshot_observed_at":"2026-08-07T10:17:26.788943Z","title":"Com- prehensive assessment of jailbreak attacks against llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.788943Z"},"links":{"cited_paper":"/paper/2402.05668","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3ec3e1bf6119ec9be9c033a5a0708c139aa2ece939013e109f3b5e283c65396d","observation_id":"266333ba-7c41-48f7-85d0-e27a04f77d93","resolution":{"observed_at":"2026-08-07T10:17:26.788943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10019","last_updated":"2024-10-05T06:50:15Z","snapshot_observed_at":"2026-08-06T04:21:24.397587Z","submitted_at":"2024-01-18T14:40:46Z","title":"R-Judge: Benchmarking Safety Risk Awareness for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10019","snapshot_observed_at":"2026-08-07T10:17:26.792352Z","title":"R-judge: Benchmarking safety risk awareness for llm agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.792352Z"},"links":{"cited_paper":"/paper/2401.10019","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:fbf2c7dbf3de4e63c132a1dcef164afffcb23bf0584b2707c64249fba0c9f124","observation_id":"c9e94feb-06c5-456c-9bf8-bdcfb066834b","resolution":{"observed_at":"2026-08-07T10:17:26.792352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.795573Z","title":"Do-not-answer: Evaluating safeguards in llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.795573Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:4451f033218fb31f1169eb4e8309ef50e018ca502aa9f9a46035bfcaac7fb024","observation_id":"18774a35-b8c8-4437-ab17-31ec03d9fba4","resolution":{"observed_at":"2026-08-07T10:17:26.795573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17626","last_updated":"2024-06-25T15:13:02Z","snapshot_observed_at":"2026-08-10T22:52:18.410190Z","submitted_at":"2024-06-25T15:13:02Z","title":"CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17626","snapshot_observed_at":"2026-08-07T10:17:26.798413Z","title":"Cosafe: Evaluating large language model safety in multi-turn dialogue coreference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.798413Z"},"links":{"cited_paper":"/paper/2406.17626","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:7038ed6e1acc4b62bf8ee26e5ee60d1745bec22b262c6ddfead6336353398031","observation_id":"57447a39-ddb6-4026-9b68-e17685ee28aa","resolution":{"observed_at":"2026-08-07T10:17:26.798413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12855","last_updated":"2024-10-18T02:35:22Z","snapshot_observed_at":"2026-08-10T13:16:27.230328Z","submitted_at":"2024-10-11T14:56:28Z","title":"JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12855","snapshot_observed_at":"2026-08-07T10:17:26.801585Z","title":"Jailjudge: A comprehensive jailbreak judge benchmark with multi-agent enhanced explanation evaluation framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.801585Z"},"links":{"cited_paper":"/paper/2410.12855","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:8f423ab6ed4351356c7a4390e67c22ecd9a168e183bb598f59c50b48ad73b7d5","observation_id":"39f87ec4-b572-468a-8ca6-49826f53a9bd","resolution":{"observed_at":"2026-08-07T10:17:26.801585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-08-10T23:28:14.284078Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-07T10:17:26.804783Z","title":"Sorry-bench: Systematically evalu- ating large language model safety refusal behaviors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.804783Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:a322f1b7e7f01f5635d9f4b87aee3ebdaf698099d49b0293f84b89c62c851da9","observation_id":"5d669970-5c06-4d74-98f9-d4fed5a5a342","resolution":{"observed_at":"2026-08-07T10:17:26.804783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05993","last_updated":"2024-09-11T14:42:29Z","snapshot_observed_at":"2026-08-09T05:46:29.961103Z","submitted_at":"2024-04-09T03:54:28Z","title":"AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05993","snapshot_observed_at":"2026-08-07T10:17:26.807876Z","title":"Aegis: Online adaptive ai content safety moderation with ensemble of llm experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.807876Z"},"links":{"cited_paper":"/paper/2404.05993","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:6138d5e946c5d93e2bd69caa5c74e5bf74a7b56e88e606e7fe7c15b9c18779e0","observation_id":"ce2e4144-2beb-4ad1-a941-531422c683b6","resolution":{"observed_at":"2026-08-07T10:17:26.807876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-03T21:40:53.683032Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-07T10:17:26.810690Z","title":"Salad-bench: A hierarchical and comprehensive safety benchmark for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.810690Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:df3bdf900fe1ed29b943fce49181fe74e8b07ef3ddfd4bb3b95cca8f2b58f045","observation_id":"d7eb6bf1-2690-4630-8596-899c53113dab","resolution":{"observed_at":"2026-08-07T10:17:26.810690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08676","last_updated":"2024-06-24T08:50:22Z","snapshot_observed_at":"2026-07-06T17:59:29.408432Z","submitted_at":"2024-04-06T15:01:47Z","title":"ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08676","snapshot_observed_at":"2026-08-07T10:17:26.813755Z","title":"Alert: A comprehensive benchmark for assess- ing large language models’ safety through red teaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.813755Z"},"links":{"cited_paper":"/paper/2404.08676","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:c8b09e5bd87549c681bd1841568eaa44905682a6cf2d029489d0abaff76bd04b","observation_id":"572e6694-eddc-49d5-851b-3534c1deaa90","resolution":{"observed_at":"2026-08-07T10:17:26.813755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-06T04:32:59.039501Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-08-07T10:17:26.817179Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.817179Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:eca6da9d7037fb07a01bf78d33642659b3a410f7f8e189d6d302dc0f52d9bee6","observation_id":"cf1de549-be79-4d74-a134-3f4e255ace61","resolution":{"observed_at":"2026-08-07T10:17:26.817179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-07T10:17:26.820201Z","title":"\" do anything now","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.820201Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:141fe21bb50ce93b0f4ab0d2fe76388ba8b9b52fec69609989b8ac47628ceaba","observation_id":"8ba49cd3-3476-4039-9bd9-4f94ab3c2c62","resolution":{"observed_at":"2026-08-07T10:17:26.820201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10311","last_updated":"2024-09-02T03:37:35Z","snapshot_observed_at":"2026-08-03T16:07:02.458133Z","submitted_at":"2024-06-14T06:47:40Z","title":"CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10311","snapshot_observed_at":"2026-08-07T10:17:26.823250Z","title":"Chisafetybench: A chinese hierarchical safety benchmark for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.823250Z"},"links":{"cited_paper":"/paper/2406.10311","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:9924ee8f673c52802785d7a1bade6b5f0374f943d000cc8647b4465adc188465","observation_id":"add6c427-c3f2-48e9-81f7-29d979303741","resolution":{"observed_at":"2026-08-07T10:17:26.823250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12193","last_updated":"2024-08-04T08:56:33Z","snapshot_observed_at":"2026-08-09T14:17:12.421154Z","submitted_at":"2024-02-19T14:56:18Z","title":"A Chinese Dataset for Evaluating the Safeguards in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12193","snapshot_observed_at":"2026-08-07T10:17:26.826456Z","title":"A chinese dataset for evaluating the safeguards in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.826456Z"},"links":{"cited_paper":"/paper/2402.12193","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:e196185efa309c9e7bbf20b9871a755ceb311486cab27627a7d5795a6d935dd7","observation_id":"5b538f84-aa5b-4c16-8f9c-b01e0a256f96","resolution":{"observed_at":"2026-08-07T10:17:26.826456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18935","last_updated":"2025-02-26T08:36:42Z","snapshot_observed_at":"2026-08-11T07:36:33.523888Z","submitted_at":"2025-02-26T08:36:42Z","title":"JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18935","snapshot_observed_at":"2026-08-07T10:17:26.829492Z","title":"Jailbench: A com- prehensive chinese security assessment benchmark for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.829492Z"},"links":{"cited_paper":"/paper/2502.18935","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:783ed05aa9fd6a027bf4ccfe93ca0a381ec3ab500378d8a72d54d5fd97da97aa","observation_id":"5e22d829-7044-4107-85cd-2be2c5548390","resolution":{"observed_at":"2026-08-07T10:17:26.829492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04752","last_updated":"2024-06-07T08:52:24Z","snapshot_observed_at":"2026-08-05T22:09:34.368887Z","submitted_at":"2024-06-07T08:52:24Z","title":"CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04752","snapshot_observed_at":"2026-08-07T10:17:26.832528Z","title":"Criskeval: A chinese multi-level risk evalu- ation benchmark dataset for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.832528Z"},"links":{"cited_paper":"/paper/2406.04752","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:b9424d3546c5b633d72574f623459d89d98a22e047651771f542a7ab24af8f12","observation_id":"ca731799-ea27-4e7a-9c7b-1f1e839cc98a","resolution":{"observed_at":"2026-08-07T10:17:26.832528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18491","last_updated":"2025-04-13T06:16:49Z","snapshot_observed_at":"2026-08-04T13:17:25.983525Z","submitted_at":"2024-10-24T07:25:29Z","title":"ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18491","snapshot_observed_at":"2026-08-07T10:17:26.835560Z","title":"Chinesesafe: A chinese benchmark for evaluating safety in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.835560Z"},"links":{"cited_paper":"/paper/2410.18491","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:28883b8fe9d1a7a18a4aa6f21bcfc1d6c8d0cc7a8c64b4a9eb77114b556a4086","observation_id":"5ff719d5-d45f-4af8-8b86-829aab8d9f95","resolution":{"observed_at":"2026-08-07T10:17:26.835560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08487","last_updated":"2023-08-28T08:35:28Z","snapshot_observed_at":"2026-07-06T15:54:51.088869Z","submitted_at":"2023-07-17T13:49:52Z","title":"Latent Jailbreak: A Benchmark for Evaluating Text Safety and Output Robustness of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08487","snapshot_observed_at":"2026-08-07T10:17:26.838444Z","title":"Latent jailbreak: A benchmark for evaluating text safety and output robustness of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.838444Z"},"links":{"cited_paper":"/paper/2307.08487","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:658051a70910abeecf1ffb1e69aa82425086b5222798ef33c0464072c455f663","observation_id":"4d02dc49-52e6-4edc-bd31-c0d406093cc2","resolution":{"observed_at":"2026-08-07T10:17:26.838444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.841712Z","title":"Safetybench: Evaluating the safety of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.841712Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:70a4ae7ed36a6c312319f9d93e4cb37a2bbe73459b6fcc564875fad1d8151123","observation_id":"b06fc21c-6af4-4cd9-8846-993cfd87ade3","resolution":{"observed_at":"2026-08-07T10:17:26.841712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-10T20:03:49.769456Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-07T10:17:26.844499Z","title":"S-eval: Automatic and adaptive test generation for benchmarking safety evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.844499Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:d4fe1828316a0124b004d7b9fe81c7b60f11b85f365622f83e602db113b016c6","observation_id":"d4ac6a66-df10-4627-9818-94933ba03a0e","resolution":{"observed_at":"2026-08-07T10:17:26.844499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09017","last_updated":"2024-11-05T02:19:26Z","snapshot_observed_at":"2026-08-11T06:30:24.207111Z","submitted_at":"2024-03-14T00:45:24Z","title":"AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09017","snapshot_observed_at":"2026-08-07T10:17:26.847859Z","title":"Aratrust: An evaluation of trustworthiness for llms in arabic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.847859Z"},"links":{"cited_paper":"/paper/2403.09017","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:810efdf2201a97327f1194f1ff13e608023050042f471a711bdea6a6f8e3489b","observation_id":"ba7ea828-025e-419d-8261-7f473360d64b","resolution":{"observed_at":"2026-08-07T10:17:26.847859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02372","last_updated":"2025-06-03T02:18:59Z","snapshot_observed_at":"2026-08-07T23:16:46.716621Z","submitted_at":"2025-06-03T02:18:59Z","title":"AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02372","snapshot_observed_at":"2026-08-07T10:17:26.850823Z","title":"Answercarefully: A dataset for improving the safety of japanese llm output,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.850823Z"},"links":{"cited_paper":"/paper/2506.02372","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:1cd86ec3fc3934da3b6febf20e6de06b341be7fc959a3a776f5b17241b83acc0","observation_id":"5cf06d1a-4497-4622-81af-3c946d84e8ef","resolution":{"observed_at":"2026-08-07T10:17:26.850823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.853966Z","title":"All languages matter: On the multilingual safety of llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.853966Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:3a5d52172ea1b199949cdb689c71bac95c6e71e9f273b460bc6f737bc5a6fdf9","observation_id":"a560036a-b759-40a8-94fa-e2463d811690","resolution":{"observed_at":"2026-08-07T10:17:26.853966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06369","last_updated":"2024-10-07T17:13:45Z","snapshot_observed_at":"2026-08-10T09:52:57.514207Z","submitted_at":"2024-06-10T15:30:13Z","title":"Annotation alignment: Comparing LLM and human annotations of conversational safety","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06369","snapshot_observed_at":"2026-08-07T10:17:26.856833Z","title":"Annotation alignment: Compar- ing llm and human annotations of conversational safety,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.856833Z"},"links":{"cited_paper":"/paper/2406.06369","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:306584de31e63d76a701494b77858788e1a2533b2ea207804228c98aea9854f1","observation_id":"0a192469-b02d-4b1a-8cf1-e5ce6f13696e","resolution":{"observed_at":"2026-08-07T10:17:26.856833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.859660Z","title":"Making them ask and answer: Jailbreaking large language models in few queries via disguise and reconstruction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.859660Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:2f8407521cf1fd5fddd5743b1958fe913c320d1e42c271dddcd492c1797e36c7","observation_id":"d69db30b-4bb4-4c01-aa10-698b3e24da60","resolution":{"observed_at":"2026-08-07T10:17:26.859660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-07T06:17:52.920196Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-07T10:17:26.862405Z","title":"Autodefense: Multi-agent llm defense against jailbreak attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.862405Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:924893d2682584a89f5fcf9d90be22a5c505aed0aa150a5acb2c77d5fe2f5dbb","observation_id":"20c6fe58-3282-48ed-ad79-6b3d4083e531","resolution":{"observed_at":"2026-08-07T10:17:26.862405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.865748Z","title":"OpenAI Moderation Endpoint,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.865748Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:0024b39484050dfea0ea931a79daed4ae45ba31262f17658611bc57ccaee7498","observation_id":"59200a37-2356-4583-acc2-ca972c923fea","resolution":{"observed_at":"2026-08-07T10:17:26.865748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.868477Z","title":"Google Perspective API,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.868477Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:4c67987ecafb04c3d188103da69fca570bedff1fff9bfb9098866d444868aa43","observation_id":"7a5329e4-ad5b-4d08-aa82-9428ead862d0","resolution":{"observed_at":"2026-08-07T10:17:26.868477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.871153Z","title":"Microsoft Azure AI Content Safety API,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.871153Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:fc1baa178d10f1f4cb355e60f9b7cf7ffbb2e75555bae7ee051285f731bc570a","observation_id":"75da5195-c3f9-48c7-8bf0-0314bf98f532","resolution":{"observed_at":"2026-08-07T10:17:26.871153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-07T10:17:26.873729Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.873729Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:df78b9b36ef814ea1a1ecbdc2c7c877d6aee95646b4f8f56063869a2fc6b7d3e","observation_id":"ac0c4c18-e839-48df-8d70-87d8e6188ef2","resolution":{"observed_at":"2026-08-07T10:17:26.873729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-07T10:17:26.876762Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.876762Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:06b544f92ffe95d33e27874cd05afe9dd603640d2089285b5162846414a605b1","observation_id":"e18b27fe-1e54-491a-a7c3-874bbcf659ff","resolution":{"observed_at":"2026-08-07T10:17:26.876762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T10:17:26.879793Z","title":"Jailbreaking black box large language models in twenty queries,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.879793Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:00a713d806accab72b1d5b542db218b9316fe2e208f4a28d4d69b62f1427db81","observation_id":"6627fce0-2607-4a62-b456-df324fc6b2e2","resolution":{"observed_at":"2026-08-07T10:17:26.879793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T10:17:26.883048Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.883048Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:10df89aefd23ba7ce38336499c46c2b6d9351adf5cf1f43652a74ee4b2705bf2","observation_id":"3c351043-6e22-4ba2-8063-e415567b38df","resolution":{"observed_at":"2026-08-07T10:17:26.883048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T10:17:26.886326Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.886326Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:7b222b043f0bbc257afc04207b60d14f39330b8fda9999614b058989ee986498","observation_id":"424edd04-e787-49a4-8572-4b0d520bdb7d","resolution":{"observed_at":"2026-08-07T10:17:26.886326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.890022Z","title":"Meta llama guard 2,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.890022Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:c0a728c3118ae7cce21a13a6ac0f51b24804353aca4a16811ce83553c284eaa4","observation_id":"fb742edd-25b6-40c3-8c08-6af92546d598","resolution":{"observed_at":"2026-08-07T10:17:26.890022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:26.893183Z","title":"The llama 3 family of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.893183Z"},"links":{"citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:7829c8886c271e99cd2abdb7c23c47a6a99970b631236c15658c4de4944d5a3c","observation_id":"cf752b6e-8bba-46ef-8dac-e08e997d178e","resolution":{"observed_at":"2026-08-07T10:17:26.893183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:17:26.896104Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.896104Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:bcf7aee6ede886be48bfafa52ca8d234cea7460d885ee257e974a27b559ec59d","observation_id":"d80a1f43-2742-44ff-a2a1-31cf88ef4dc3","resolution":{"observed_at":"2026-08-07T10:17:26.896104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":215},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 215 outbound references and 9 inbound Pith citation observations for arXiv:2506.11094."}